H3 视频工作站
返回文章列表
提示词

同一个镜头,我在 H3 和 Seedance 上各改了 7 遍

·约 3 分钟

测试素材统一:一条带货短视频里的 5 秒镜头——女主从画面右侧入镜,走到桌边拿起杯子。1280×720,24fps,没有对白。

目标只有一个:在不改变构图的前提下,让手部动作不糊。

先说结论

七轮改下来,最反直觉的一条是:两个模型对「动作描述」的敏感度差异,远小于对「镜头语言」的差异。

改动项H3 的变化Seedance 的变化
加「缓慢」手部糊率 38% → 21%基本无变化
加「手持镜头轻微晃动」画面开始漂移真实度明显提升
删掉「电影感」无变化色彩发灰
动作拆成两拍21% → 9%34% → 12%

糊率=逐帧比对中手部区域清晰度低于阈值的帧占比,样本 120 帧。同一段素材、同一台机器、同一天跑完。

意思是:动作描述你知道怎么写就能写对,镜头语言你得按模型分别试。 前者是可复用的知识,后者是每个模型自己的脾气。

骨架先定死

不管换哪个模型,前三行我不动:

主体:年轻女性,右手拿白色陶瓷杯
动作:从画面右侧走入,停在桌边,拿起杯子
镜头:中景,固定机位,视线高度

这三行是画面骨架。它规定的不是风格,是「画面里发生了什么」。骨架里出现的每个词,都应该能在原片里指出来——指不出来,就等于让模型替你编。

我踩过的坑是往骨架里塞形容词:写「优雅地拿起杯子」,模型就开始自己发挥运镜和光线,构图跟着跑偏。形容词是风格层的事,别混进骨架。

H3 的七轮

关键改动发生在第 4 轮——把手部动作拆成两拍:

动作:从画面右侧走入,停在桌边;停顿约半秒;右手拿起杯子

分号加「停顿半秒」,本质是给模型一个呼吸点。原来的写法里,「停下」和「拿杯子」被压缩在同一拍内,模型必须在极短时间里同时处理两个动作,手部就糊了。拆开之后,糊率从 21% 掉到 9%。

这个改法对任何涉及手部精细动作的镜头都值得先试一遍,成本极低。

Seedance 的差异

Seedance 不吃「停顿半秒」这种描述,写不写几乎没差别。但它对镜头语言很敏感:

加「手持镜头轻微晃动」之后,画面的真实度提升明显,代价是构图会漂——需要重新加约束把主体位置钉住。删掉「电影感」会让色彩发灰,说明它对这个词有实际响应,而 H3 基本无视。

同一个词在两个模型上的作用可以完全不同,所以别直接抄别人的提示词。

收尾清单

  1. 骨架三行不轻易动,形容词不进骨架
  2. 动作拆分优于堆形容词,尤其手上活
  3. 镜头语言按模型分别调,网上的提示词别照抄
  4. 每次只改一处,改完记下数字——七轮能收敛,靠的是每轮只动一个变量

如果你也在做同类对照实验,欢迎把数字发我,攒多了可以出一份跨模型的敏感度对照表。