mirror of
https://github.com/zhouxiaoka/autoclip.git
synced 2026-10-02 02:34:34 +08:00
4.8 KiB
4.8 KiB
一条链接的成本与时间(实测 2026-10-01)
本机:Apple Silicon Mac,渲染低优先级、单线程排队;文字模型 qwen-plus(DashScope),价格按 ¥0.8 / 百万输入 tokens、¥2 / 百万输出 tokens 估算(第三方汇总价,以阿里云百炼官网为准)。语音识别为本地 Whisper base(免费,耗本机 CPU)。用量来自每个项目的 metadata/llm_usage.jsonl。这些是迭代期间不同素材、输出数量和处理设置的历史记录,不是同一输入的性能对照或正式包的统一测速。费用仅为当时文字模型的估算,未包含云端转写、视觉模型、AI 生图与投稿服务;实际按所选服务商账单结算。
四条真实素材
| 视频 | 时长 | 链路 | 链接 → 完成 | 片段 → 自动成片 | 模型调用 | tokens(入 / 出) | 模型费用 |
|---|---|---|---|---|---|---|---|
| MrBeast(英文 → TikTok) | 2h06m | 旧链路 | 65 分钟 | 33 → 33 | 194 次 | 53.1 万 / 10.6 万 | ¥0.64 |
| Karpathy(英文 → 抖音) | 2h26m | 过渡(一次挑片 + 硬件编码) | 34 分钟 | 25 → 25 | 53 次 | 14.3 万 / 2.5 万 | ¥0.16 |
| Jensen Huang(英文 → 小红书) | 1h43m | 新链路 | 7.5 分钟 | 21 → 10(其余备选) | 34 次 | 7.7 万 / 1.2 万 | ¥0.09 |
| TIM × 罗永浩(中文 → 抖音) | 2h52m | 新链路,无字幕 | 29.5 分钟 | 18 → 10 | 32 次 | 22.2 万 / 1.1 万 | ¥0.20 |
时间花在哪
| 阶段 | 旧(MrBeast) | 新(Jensen,有作者字幕) | 新(TIM,无字幕) |
|---|---|---|---|
| 下载 | ~1 分 | ~1 分 | ~1 分 |
| 语音识别 | 9.3 分 | 0(直接用作者上传的字幕) | 23 分(中文 2h52m,本地 Whisper) |
| 选片段 | 35 分(4 步、128 次调用依次执行) | 25 秒(2 次调用) | ~40 秒(4 次) |
| 切点精修 + 取景 + 包装 | ~6 分 | ~2.5 分(并行) | ~3 分 |
| 渲染 | 14 分(33 支) | 3 分(10 支,硬件编码) | 2.8 分(10 支) |
云端语音识别后(回归集,2026-10-01)
语音识别改为百炼 qwen-audio-3.1-asr-flash(8 路并行上传),其余同上。数据来自 benchmarks/fast_output/reports/20261001-1453(Dafoe、DevDay 取修正后的 20261001-1722)。费用只算文字模型;云端语音识别按百炼的音频时长另计,未计入下表。
| 素材 | 时长 | 平台 | 链接 → 完成 | 语音识别 | 挑片 | 渲染 | 片段 → 自动成片 | 模型费用 |
|---|---|---|---|---|---|---|---|---|
| Stallone × NYT | 1h17m | 抖音 | 4.5 分 | 104 秒 | 8 秒 | 71 秒 | 5 → 5 | ¥0.02 |
| Dafoe × Hot Ones | 23m | TikTok + 抖音 | 5.7 分 | 37 秒 | 11 秒 | 136 秒 | 14 → 14 | ¥0.07 |
| Dreamforce 主题演讲 | 1h48m | 抖音 | 6.1 分 | 0(平台字幕) | 22 秒 | 132 秒 | 13 → 10 | ¥0.11 |
| 鲁豫 × 郭柯宇 | 2h45m | 抖音 | 8.7 分 | 233 秒 | 23 秒 | 186 秒 | 23 → 10 | ¥0.13 |
| 李诞 × 王祖贤 | 2h00m | 抖音 + 小红书 | 9.3 分 | 168 秒 | 24 秒 | 281 秒 | 42 → 20 | ¥0.10 |
| Druski × DOAC | 1h48m | TikTok | 10.0 分 | 153 秒 | 37 秒 | 182 秒 | 22 → 10 | ¥0.10 |
| OpenAI DevDay | 53m | TikTok + B 站 | 13.2 分 | 62 秒 | 17 秒 | 419 秒 | 22 → 20 | ¥0.08 |
| Rubin × DOAC | 2h46m | 抖音 + Shorts | 18.2 分 | 199 秒 | 24 秒 | 456 秒 | 66 → 20 | ¥0.15 |
| Neumann × DOAC | 2h15m | 抖音 + TikTok | 22.4 分 | 889 秒* | 15 秒 | 241 秒 | 42 → 20 | ¥0.17 |
* Neumann 的语音识别明显偏慢(889 秒),原因还没确认(可能是当时上传排队),下次回归复测;同类 2–3 小时素材其余都在 2.5–4 分钟。TIM × 罗永浩(2h52m 中文)语音识别 23 分钟(本地 Whisper)→ 3.6 分钟。
这组记录中,追加平台增加了渲染耗时,横屏 B 站版较慢。当前按每个平台的资格规则筛选后,自动制作评分最高的至多 10 条合格候选;实际数量取决于素材与平台,追加平台还可能增加翻译和包装的模型调用。
使用这些记录时
- 作者字幕可跳过转写;无字幕时,本地转写耗本机资源,云端转写另按音频时长或服务商规则计费。这组云端记录包含明显偏慢的个例,不能据此保证处理时间。
- 片段数量、取景方式、字幕、目标平台、并发设置与硬件都会影响耗时。这里的价格估算和速度仅对应表中的测试条件。
- 每个平台先过滤资格、再选评分最高的至多 10 条自动制作;其余候选按需生成。追加平台或生成备选会增加渲染和模型用量,不应按固定成本或“片数翻倍”承诺。
- 正式安装包的验收状态见 1.5.0 验收与发版。重新测速时应另记日期、源码或安装包版本、输入、模型与输出数量,保留原始记录。