返回文章列表
四个视觉模型读同一段视频,谁认得出「谁在说话」

做视频复刻绕不开一个问题:这句话是谁说的。 画面里有两个人,台词要挂到正确的角色上,否则改台词时会把 B 的台词塞给 A。
我用 6 条双人对话素材、每条 36 格,测了四个视觉模型。结论比我预期的更集中。
结论一:喂法的影响远大于厂商
同一批素材,换两种喂法:
| 喂法 | 归属判断 | 正确率 |
|---|---|---|
| 逐格图片(把 36 格当独立图片喂) | 31 对 / 22 错 | 58% |
| 整段视频(带时间轴一起喂) | 35 对 / 1 错 | 97% |
差 39 个百分点,而这还只是换喂法,模型一个字没换。
原因不复杂:说「谁在说话」本质上需要看口型随时间的开合,单张图片里口型是静止的,模型只能靠构图猜。带上时间轴,它就有的看了。
所以「A 模型比 B 模型强」这种结论在这件事上基本没意义——先把喂法调对,再谈选型。
结论二:抄台词要用格,判断归属要用视频
两种喂法各有所长,别指望一种通吃:
- 抄台词:逐格图片更好。格子切得干净,文字识别稳定。
- 判断归属、看运镜:整段视频更好,因为这两件事本质都是时间上的事。
所以真实管线里我两种都会跑:格子出文本,视频出归属,最后按时间码对齐合并。
结论三:任何模型都不能自报镜数
这条最反直觉,也最容易踩:问模型「这段有几个镜头」,没一个答对。
四个模型的过报倍数都在 1.9 倍以上——一段 12 个镜头的素材,模型普遍报 23 个以上。它们倾向于把一次运镜、一次光线变化都算成新镜头。
所以镜头表不能问模型,必须用本地的镜头切分检测器先切好,再把真实镜头表注入给模型。模型只负责「这一格里发生了什么」,不负责「这算不算一个镜头」。
分工清楚之后,切点准确率才谈得上。
评测怎么跑的
三个原则,避免自我欺骗:
- 样本量说清楚。36 格 × 6 素材=216 个判断,不是我挑两张图看着差不多就算。
- 真值先定死。真值由人工标注,标完就冻结,测的过程中不许改。
- 只换一个变量。这次只换喂法,模型、素材、提示词全部锁死。
落到使用上
如果你在用这类工具做复刻,遇到归属错乱,先别怪模型。检查两件事:喂的是视频还是静帧、镜头表是模型报的还是本地切的。 这两处调对,绝大多数归属问题会自己消失。