返回文章列表
同一个镜头,我在 H3 和 Seedance 上各改了 7 遍

测试素材统一:一条带货短视频里的 5 秒镜头——女主从画面右侧入镜,走到桌边拿起杯子。1280×720,24fps,没有对白。
目标只有一个:在不改变构图的前提下,让手部动作不糊。
先说结论
七轮改下来,最反直觉的一条是:两个模型对「动作描述」的敏感度差异,远小于对「镜头语言」的差异。
| 改动项 | H3 的变化 | Seedance 的变化 |
|---|---|---|
| 加「缓慢」 | 手部糊率 38% → 21% | 基本无变化 |
| 加「手持镜头轻微晃动」 | 画面开始漂移 | 真实度明显提升 |
| 删掉「电影感」 | 无变化 | 色彩发灰 |
| 动作拆成两拍 | 21% → 9% | 34% → 12% |
糊率=逐帧比对中手部区域清晰度低于阈值的帧占比,样本 120 帧。同一段素材、同一台机器、同一天跑完。
意思是:动作描述你知道怎么写就能写对,镜头语言你得按模型分别试。 前者是可复用的知识,后者是每个模型自己的脾气。
骨架先定死
不管换哪个模型,前三行我不动:
主体:年轻女性,右手拿白色陶瓷杯
动作:从画面右侧走入,停在桌边,拿起杯子
镜头:中景,固定机位,视线高度
这三行是画面骨架。它规定的不是风格,是「画面里发生了什么」。骨架里出现的每个词,都应该能在原片里指出来——指不出来,就等于让模型替你编。
我踩过的坑是往骨架里塞形容词:写「优雅地拿起杯子」,模型就开始自己发挥运镜和光线,构图跟着跑偏。形容词是风格层的事,别混进骨架。
H3 的七轮
关键改动发生在第 4 轮——把手部动作拆成两拍:
动作:从画面右侧走入,停在桌边;停顿约半秒;右手拿起杯子
分号加「停顿半秒」,本质是给模型一个呼吸点。原来的写法里,「停下」和「拿杯子」被压缩在同一拍内,模型必须在极短时间里同时处理两个动作,手部就糊了。拆开之后,糊率从 21% 掉到 9%。
这个改法对任何涉及手部精细动作的镜头都值得先试一遍,成本极低。
Seedance 的差异
Seedance 不吃「停顿半秒」这种描述,写不写几乎没差别。但它对镜头语言很敏感:
加「手持镜头轻微晃动」之后,画面的真实度提升明显,代价是构图会漂——需要重新加约束把主体位置钉住。删掉「电影感」会让色彩发灰,说明它对这个词有实际响应,而 H3 基本无视。
同一个词在两个模型上的作用可以完全不同,所以别直接抄别人的提示词。
收尾清单
- 骨架三行不轻易动,形容词不进骨架
- 动作拆分优于堆形容词,尤其手上活
- 镜头语言按模型分别调,网上的提示词别照抄
- 每次只改一处,改完记下数字——七轮能收敛,靠的是每轮只动一个变量
如果你也在做同类对照实验,欢迎把数字发我,攒多了可以出一份跨模型的敏感度对照表。