H3 视频工作站
返回文章列表
模型评测

四个视觉模型读同一段视频,谁认得出「谁在说话」

·约 3 分钟

做视频复刻绕不开一个问题:这句话是谁说的。 画面里有两个人,台词要挂到正确的角色上,否则改台词时会把 B 的台词塞给 A。

我用 6 条双人对话素材、每条 36 格,测了四个视觉模型。结论比我预期的更集中。

结论一:喂法的影响远大于厂商

同一批素材,换两种喂法:

喂法归属判断正确率
逐格图片(把 36 格当独立图片喂)31 对 / 22 错58%
整段视频(带时间轴一起喂)35 对 / 1 错97%

差 39 个百分点,而这还只是换喂法,模型一个字没换。

原因不复杂:说「谁在说话」本质上需要看口型随时间的开合,单张图片里口型是静止的,模型只能靠构图猜。带上时间轴,它就有的看了。

所以「A 模型比 B 模型强」这种结论在这件事上基本没意义——先把喂法调对,再谈选型。

结论二:抄台词要用格,判断归属要用视频

两种喂法各有所长,别指望一种通吃:

  • 抄台词:逐格图片更好。格子切得干净,文字识别稳定。
  • 判断归属、看运镜:整段视频更好,因为这两件事本质都是时间上的事。

所以真实管线里我两种都会跑:格子出文本,视频出归属,最后按时间码对齐合并。

结论三:任何模型都不能自报镜数

这条最反直觉,也最容易踩:问模型「这段有几个镜头」,没一个答对。

四个模型的过报倍数都在 1.9 倍以上——一段 12 个镜头的素材,模型普遍报 23 个以上。它们倾向于把一次运镜、一次光线变化都算成新镜头。

所以镜头表不能问模型,必须用本地的镜头切分检测器先切好,再把真实镜头表注入给模型。模型只负责「这一格里发生了什么」,不负责「这算不算一个镜头」。

分工清楚之后,切点准确率才谈得上。

评测怎么跑的

三个原则,避免自我欺骗:

  1. 样本量说清楚。36 格 × 6 素材=216 个判断,不是我挑两张图看着差不多就算。
  2. 真值先定死。真值由人工标注,标完就冻结,测的过程中不许改。
  3. 只换一个变量。这次只换喂法,模型、素材、提示词全部锁死。

落到使用上

如果你在用这类工具做复刻,遇到归属错乱,先别怪模型。检查两件事:喂的是视频还是静帧、镜头表是模型报的还是本地切的。 这两处调对,绝大多数归属问题会自己消失。