Files
autoclip/docs/COST_PER_VIDEO.md

4.8 KiB
Raw Permalink Blame History

一条链接的成本与时间(实测 2026-10-01)

本机:Apple Silicon Mac,渲染低优先级、单线程排队;文字模型 qwen-plus(DashScope),价格按 ¥0.8 / 百万输入 tokens、¥2 / 百万输出 tokens 估算(第三方汇总价,以阿里云百炼官网为准)。语音识别为本地 Whisper base(免费,耗本机 CPU)。用量来自每个项目的 metadata/llm_usage.jsonl。这些是迭代期间不同素材、输出数量和处理设置的历史记录,不是同一输入的性能对照或正式包的统一测速。费用仅为当时文字模型的估算,未包含云端转写、视觉模型、AI 生图与投稿服务;实际按所选服务商账单结算。

四条真实素材

视频 时长 链路 链接 → 完成 片段 → 自动成片 模型调用 tokens(入 / 出) 模型费用
MrBeast(英文 → TikTok) 2h06m 旧链路 65 分钟 33 → 33 194 次 53.1 万 / 10.6 万 ¥0.64
Karpathy(英文 → 抖音) 2h26m 过渡(一次挑片 + 硬件编码) 34 分钟 25 → 25 53 次 14.3 万 / 2.5 万 ¥0.16
Jensen Huang(英文 → 小红书) 1h43m 新链路 7.5 分钟 21 → 10(其余备选) 34 次 7.7 万 / 1.2 万 ¥0.09
TIM × 罗永浩(中文 → 抖音) 2h52m 新链路,无字幕 29.5 分钟 18 → 10 32 次 22.2 万 / 1.1 万 ¥0.20

时间花在哪

阶段 旧(MrBeast) 新(Jensen,有作者字幕) 新(TIM,无字幕)
下载 ~1 分 ~1 分 ~1 分
语音识别 9.3 分 0(直接用作者上传的字幕) 23 分(中文 2h52m,本地 Whisper)
选片段 35 分(4 步、128 次调用依次执行) 25 秒(2 次调用) ~40 秒(4 次)
切点精修 + 取景 + 包装 ~6 分 ~2.5 分(并行) ~3 分
渲染 14 分(33 支) 3 分(10 支,硬件编码) 2.8 分(10 支)

云端语音识别后(回归集,2026-10-01)

语音识别改为百炼 qwen-audio-3.1-asr-flash(8 路并行上传),其余同上。数据来自 benchmarks/fast_output/reports/20261001-1453(Dafoe、DevDay 取修正后的 20261001-1722)。费用只算文字模型;云端语音识别按百炼的音频时长另计,未计入下表。

素材 时长 平台 链接 → 完成 语音识别 挑片 渲染 片段 → 自动成片 模型费用
Stallone × NYT 1h17m 抖音 4.5 分 104 秒 8 秒 71 秒 5 → 5 ¥0.02
Dafoe × Hot Ones 23m TikTok + 抖音 5.7 分 37 秒 11 秒 136 秒 14 → 14 ¥0.07
Dreamforce 主题演讲 1h48m 抖音 6.1 分 0(平台字幕) 22 秒 132 秒 13 → 10 ¥0.11
鲁豫 × 郭柯宇 2h45m 抖音 8.7 分 233 秒 23 秒 186 秒 23 → 10 ¥0.13
李诞 × 王祖贤 2h00m 抖音 + 小红书 9.3 分 168 秒 24 秒 281 秒 42 → 20 ¥0.10
Druski × DOAC 1h48m TikTok 10.0 分 153 秒 37 秒 182 秒 22 → 10 ¥0.10
OpenAI DevDay 53m TikTok + B 站 13.2 分 62 秒 17 秒 419 秒 22 → 20 ¥0.08
Rubin × DOAC 2h46m 抖音 + Shorts 18.2 分 199 秒 24 秒 456 秒 66 → 20 ¥0.15
Neumann × DOAC 2h15m 抖音 + TikTok 22.4 分 889 秒* 15 秒 241 秒 42 → 20 ¥0.17

* Neumann 的语音识别明显偏慢(889 秒),原因还没确认(可能是当时上传排队),下次回归复测;同类 2–3 小时素材其余都在 2.5–4 分钟。TIM × 罗永浩(2h52m 中文)语音识别 23 分钟(本地 Whisper)→ 3.6 分钟。

这组记录中,追加平台增加了渲染耗时,横屏 B 站版较慢。当前按每个平台的资格规则筛选后,自动制作评分最高的至多 10 条合格候选;实际数量取决于素材与平台,追加平台还可能增加翻译和包装的模型调用。

使用这些记录时

  • 作者字幕可跳过转写;无字幕时,本地转写耗本机资源,云端转写另按音频时长或服务商规则计费。这组云端记录包含明显偏慢的个例,不能据此保证处理时间。
  • 片段数量、取景方式、字幕、目标平台、并发设置与硬件都会影响耗时。这里的价格估算和速度仅对应表中的测试条件。
  • 每个平台先过滤资格、再选评分最高的至多 10 条自动制作;其余候选按需生成。追加平台或生成备选会增加渲染和模型用量,不应按固定成本或“片数翻倍”承诺。
  • 正式安装包的验收状态见 1.5.0 验收与发版。重新测速时应另记日期、源码或安装包版本、输入、模型与输出数量,保留原始记录。