AI BASICS · 04 · VIDEO

AI会让画面动起来,为什么大多数视频还是不像作品?

AI基本功04|做视频:三大魔法 + 导演思维 · 方法开源 · 2026
这一篇主要训练:辨识力 × 担当力 × 影响力

现在让AI生成一段会动的画面,已经越来越容易。

一张图,点一下,人物动了;再加一段音频,嘴也动了。

可奇怪的是:

为什么很多AI视频明明“技术上都成功了”,看起来还是像一堆素材,而不像一个作品?

我在第4课2026-2版里,把这个问题重新拆了一遍。

最后留下的主线不是“学几个视频工具”,而是四层能力:

运镜 → 演艺 → 一致性 → 导演思维

先让画面动起来,再让角色演起来;再让多个镜头接起来,最后让故事成立。

一、第一种失败:画面会动,但它不知道往哪儿动

很多人第一次做AI视频,是把一张图丢进去,然后点击生成。

AI当然能让它动。

问题是:你没有告诉它从哪里开始、到哪里结束。

这就像你请了一位摄影师,却没有告诉他机位、路线和终点。

他只能猜。

所以第一招叫运镜魔法

首尾帧:给AI一个起点和一个终点

比如你要做“宠物做菜”的短片。

首帧:狗狗站在锅前,菜还没做好。

尾帧:狗狗端着做好的菜。

中间怎么炒、怎么端、镜头怎么移动,由AI来补。

你再加一句动作提示:

“狗狗翻炒锅中的蔬菜,最后端出做好的菜,镜头自然推进。”

这时候,AI的自由度就被压住了。

二、第二种失败:画面动了,但角色还是“哑巴”

视频真正的信息密度,很多时候来自表达。

一张猫咪照片很可爱,但如果它能开口说一句:

“新年快到了,快来夜校跟我一起学写春联吧。”

它立刻从“素材”变成“角色”。

这就是第二招:演艺魔法

最小公式其实特别简单:

一句台词 + 一段语音 + 一张主体清楚的图片 = 一个会说话的角色

人、动物、甚至物品都可以成为演员。

但这里也有一个很重要的基本功:

不是越长越好。

先让一个主体稳定地说完一句短话,再逐步增加复杂度。

AI视频特别容易让人兴奋,然后一上来就塞五个动作、三个人物、两段对白。

结果全崩。

复杂作品,往往不是一次生成复杂出来的,而是一层层稳定叠出来的。

三、第三种失败:每一个镜头都挺好,但连起来像“平行宇宙”

这是AI视频真正进入“作品阶段”后最常见的问题。

第一个镜头里主角穿蓝衣服。

第二个镜头突然变成黑衣服。

刚才还是一个厨房,下一秒台面、窗户、灯光全部重建。

动作也会断:上一镜刚刚抬手,下一镜已经换了姿势。

于是第3个魔法在2026-2版里正式变成了:一致性魔法

一致性不是一个Prompt,而是一套“少猜”系统

要让多个镜头接得上,需要提前准备三类东西:

  • 角色卡:这个人/动物到底长什么样,服装、发型、比例、识别特征是什么;
  • 场景卡:空间长什么样,光线、道具、布局和不同机位如何保持一致;
  • 分镜表 / 故事板:每个镜头从哪里接上,动作、机位、景别怎么连续。

然后逐项检查四条连续性:

角色连续 × 动作连续 × 场景连续 × 镜头连续

这里仍然建议一次只抓一个最大问题。

如果v1里最影响观看的是“角色变脸”,先修角色;不要同时重做灯光、动作、机位和台词。

这其实和经营优化很像:先找到最影响结果的那个问题。

四、为什么一定要保存v1?

这一版课程里,我特意加了一个很小但很重要的要求:第一次生成以后,先保存v1。

很多人不满意就立刻重做,最后只剩“好像变好了”的感觉。

但如果保留v1、v2,你才能真正回答:

  • 我到底改了什么?
  • 哪个修改是有效的?
  • 哪个只是换了一个随机结果?

所以AI创作不应该只是“抽卡”。

五、+1:会生成、会控制,还不等于作品值得看

到这里,技术问题基本解决了。

但还有一个问题:

“观众为什么要继续看?”

这就是最后的导演思维

专业工作流可以先记成:

选题 → 剧本 → 顺场表 → 一致性准备 → 生视频 → 剪辑成片

这条线解决“怎么生产”。

而“场、缝、钩”解决“为什么作品成立”。

场|让世界可信

“场”不是一个背景图,而是一组互相支持的证据。

如果你拍婚礼,观众为什么相信这是婚礼?

可能因为礼服、宾客、花艺、座位、表情、仪式动作共同构成一个世界。

如果只换一块写着“婚礼现场”的背景板,但人物状态、光线、动作完全不对,观众还是不信。

场,解决的是可信度。

缝|不要什么都说满,让两个镜头之间产生联想

很多故事并不是靠台词解释出来的。

一个人关门。

下一镜,一个空房间里只剩一杯凉掉的咖啡。

中间发生了什么,观众会自己补。

这个“没有拍出来、但被观众脑子补出来”的地方,就是缝。

缝,解决的是联想空间。

钩|先留下一个问题,再让后面回收

深夜里传来脚步声。

门把手开始转。

观众脑子会自动生成一个问题:谁在外面?

这就是钩。

如果下一秒立刻告诉你答案,张力没了。

如果适当升级,再揭晓,观众才会追下去。

钩,解决的是注意力。

场让人相信 · 缝让人联想 · 钩让人追下去

六、这节课真正训练的,不是视频工具

运镜在训练控制。

演艺在训练表达。

一致性在训练系统化。

导演思维在训练判断与影响。

所以工具会变。

今天用这个模型做首尾帧,明天可能换另一个。

但你永远需要回答:

  • 我想让画面怎么变化?
  • 我想让角色表达什么?
  • 多个镜头如何属于同一个世界?
  • 观众为什么相信、联想、继续看?

结尾:AI视频真正的分水岭

第一阶段,是“我也能让图片动起来”。

第二阶段,是“我能控制它怎么动”。

第三阶段,是“我能让多个镜头组成一个故事”。

技术决定下限,导演思维决定上限。

补充:三次练习,分别训练什么?

把“会生成”拆成三次练习,每次都有明确限制和交付物。按从单镜头到多镜头的顺序练习,才能逐步建立控制感。

练习1|运镜

让宠物完成一道菜。准备同一只宠物、同一个厨房的A图和B图,只描述一个清楚动作;生成约10秒视频,先保存“姓名-宠物做菜-v1”。

练习2|演艺

让人物、动物或物品开口说话。写20—30字台词,准备图片和语音,交付一段8—15秒、能正常播放的“姓名-数字人口播”。

练习3|一致性

打开v1,只挑一个最大问题:角色、动作、场景或镜头。做三格故事板,必要时补角色卡或场景卡,再生成v2并与v1对比。

每次练习的验收问题都很朴素:能不能播放?主体是否稳定?动作是否看得懂?补进去的那条信息,是否真的让结果更稳定?

补充:从剧本到成片,按六步走

选题 → 剧本 → 顺场表 → 一致性准备 → 生视频 → 剪辑成片

这六步可以分成四个阶段:策划、拆解、一致性准备、生产。顺场表决定要准备什么;角色卡、场景卡和道具卡决定各自长什么样;分镜表或故事板决定怎么拍。顺序不能倒过来:没有选题和剧本,生成会变成素材堆积;没有一致性准备,每个镜头都会重新猜。

最后才是“场、缝、钩”:先让观众相信这个世界,再让观众补出镜头之间的意义,最后留下一个问题并在后面回收。