口播稿本身不是画面。如果直接把整段话丢给模型「做个视频」,结果通常是堆字、堆图标、节奏与句子错位。 口播画面化的目标,是把每一句变成可执行的镜头指令。
输入准备
- 口播全文(尽量定稿)
- 带时间轴的 SRT 或词级时间戳
- 已有素材清单:截图、录屏、插画、品牌色
逐句翻译的五个字段
对每一句或每一意群,至少写清:
- 场景:这一镜发生在什么空间或信息结构里(对比、流程、单点强调)。
- 主体:观众第一眼该看什么(最多 1–3 个主元素)。
- 动作:元素如何进场、强调、退场;避免只进不出的 PPT 堆叠。
- 情绪 / 节奏:加速、停顿、放大保持,还是切换清场。
- 素材获取:用现成录屏、插画库,还是生成后锁定。
切段规则
- 切点落在句子结束处,不要在句中硬切。
- 一景大约 4–8 秒;同屏主元素不超过 3 个。
- 换景必须清场:上一景退场或降为角落缩略,禁止只进不出。
- 每 1–3 句口播至少有一次画面变化。
从分镜到实现
常见落地路径:
- 分镜表(时间、口播、画面、素材、验收点)
- 视觉系统锁定(色、字、卡片、动效阻尼)
- Remotion / HyperFrames 实现
- 按 SRT 对齐,预览与静帧 QA
- 导出与平台合规检查
好的口播画面化,不是「把字放上屏」,而是让观众在听到这句话时,正好看到这句话成立的证据。
常见失败
- 字幕与画面文案双重朗读,信息打架
- 背景整页缩放,成片无法叠到其他底板
- 黑场收尾或长时间无变化
- 没有素材先拍板,导致后期风格漂移