这套规则解决什么问题#

单图生成MV视频时,最容易出现三个问题:模型凭空增加人物或道具、把演唱写成静止摆拍、在6秒内堆叠多个动作和运镜。我的处理方式是把提示词拆成固定输入和判断规则,再由工作流组合成一段70到115个英文单词的最终提示词。

工作流需要哪些输入#

输入作用示例
关键帧图片约束真实人物、服装、场景、道具和光线女歌手站在带霓虹灯的室内
中文视频动态提示词指定这一段最重要的动作她转身看向镜头并继续演唱
视频时长限制动作数量和幅度6秒
镜头基座可选;指定一个主运镜slow push-in

在ArcTable里,中文动作和镜头基座可以来自不同字段,最终提示词作为结果返回当前行。这样每一行只处理一个镜头,适合批量执行,也方便单独修改失败片段。

ArcTable中的MV分段输入与提示词字段
ArcTable中的MV分段输入与提示词字段

判断顺序必须固定#

  1. 先观察关键帧里真实存在的主体、服装、场景、道具、光线和构图。
  2. 再读取中文动作,只保留一个主要身体动作。
  3. 如果是女歌手或表演型镜头,把演唱状态作为主体持续动作。
  4. 最后选择一个与构图不冲突的主镜头运动。
  5. 用头发、衣服、雾气、反光或灯光变化补充轻微环境动态。

这个顺序的作用,是防止文字意图覆盖图片事实。例如中文提示词写了“按下按钮”,但图片里没有按钮,就不应该凭空补一个按钮。

MV演唱镜头怎样避免变成静态摆拍#

如果画面主体是女歌手、女主播或表演者,最终提示词应持续保留演唱状态。可以使用下面这些低幅度动作:

  • 嘴唇自然开合,而不是要求复杂精准的口型同步。
  • 胸口和肩膀随呼吸轻微变化。
  • 头部按节奏小幅摆动。
  • 表情随歌词情绪变化。
  • 头发和衣服产生轻微响应。

如果中文动作要求转身、回头、看怀表或触摸镜子,应把它融合进演唱过程,而不是用这个动作替代演唱。

镜头基座怎样选择#

每个6秒分段只使用一个主运镜。主体动作越复杂,镜头越应该稳定。

镜头运动适合场景风险
Slow push-in情绪递进、脸部演唱
Slow zoom-in聚焦眼神和嘴部
Slow pan left / right横向展示人物和环境
Tilt up / down在脸部、手部和道具之间移动
Track left / right人物侧脸或轻微移动
Handheld follow街头感、情绪较强的演唱
Arc around subject全身清楚、主体居中且站姿稳定中高
Orbit / Crane move空间关系非常明确的展示镜头

人物很小、多人物重叠、脸部不清楚或道具关系复杂时,不要选择大幅环绕和强旋转。

最终提示词的组成#

一段可用的动态提示词通常包含七个部分:

  1. 图片中真实存在的主体和服装。
  2. 图片中真实存在的地点与光线。
  3. 演唱情绪。
  4. 一个主要身体动作。
  5. 嘴唇、表情或呼吸动作。
  6. 一个主镜头运动。
  7. 一到两个轻微环境反应。

下面是当前工作流使用的精简模板。{{镜头基座}}{{视频动态提示词}}由ArcTable字段传入。

TEXT
You are directing a single-keyframe LTX 2.3 cinematic MV shot.

Use only the people, clothing, scene, props, lighting and composition that are visibly present in the reference image. Treat the Chinese motion instruction as the main action direction, but compress it into one primary body action and no more than two supporting details.

When the main subject is a female singer, broadcaster or performer, keep her as the visual center and describe an active vocal performance. Include natural lips moving, rhythmic breathing, subtle head movement or expressive facial changes when her face is visible. Integrate turns, glances or prop interaction into the performance instead of replacing the singing action.

Use one main camera motion only. If a compatible user-selected camera motion is provided, use it; otherwise choose a stable motion that matches the composition. Keep stronger subject actions paired with steadier camera movement.

Add only subtle reactions already supported by the image, such as hair movement, fabric movement, reflections, mist, screen glow, blinking lights or dust in the light.

Output one English paragraph of 70 to 115 words. Do not add people, locations or props. Do not switch scenes. Keep the movement realistic and controlled for a 6-second single-image I2V shot.

Selected camera motion: {{镜头基座}}
Chinese motion instruction: {{视频动态提示词}}

为什么使用参数化字段#

如果把所有内容写死在一个提示词里,每次换镜头都要手动改整段文字。参数化以后,可以把稳定规则保留在能力单元里,只替换每行不同的中文动作和镜头基座。

通过字段传入中文动作和镜头基座
通过字段传入中文动作和镜头基座
MV分段工作流的输入、判断和输出关系
MV分段工作流的输入、判断和输出关系

失败时先检查什么#

现象优先检查
主体没有演唱感是否明确写了演唱状态、嘴唇和呼吸动作
人物或道具凭空增加是否让文字意图覆盖了关键帧事实
面部容易变形动作是否过大,是否同时要求转身、运镜和复杂口型
镜头摇晃或主体丢失是否堆叠了两个以上主运镜
画面太静在不改变主体结构的前提下补充表情、呼吸和环境反应

仍然需要单独测试的部分#

  • 不同构图对Arc around subject等运镜的承受能力不同。
  • 关键帧脸部过小或被遮挡时,文字规则不能保证面部稳定。
  • 自然演唱动作不等于精准歌词口型同步。
  • 规则只能减少提示词层面的冲突,不能替代模型、节点和采样参数测试。