这篇假设你完全没做过视频,不会剪辑,也不写代码。你只需要会用浏览器和手机。 这一篇不需要动手,一个软件都不用装,一分钱都不用花。全文约 30 分钟。 第三章讲原理,只想赶紧出片的人可以先跳过;但第六章不要跳,那一章决定的不是你做得好不好,而是你做出来的东西能不能发。
这是 AI 视频系列七篇的第一篇:
- 本篇——AI 生视频到底是怎么回事:原理、三大流派和三条红线
- 工具全景与选型:11 款国内外工具横评
- 提示词入门:让 AI 听懂你要的那个画面
- 实操:小云雀 & 即梦,做出第一段视频
- 实操:可灵 & 海螺,追求画质与角色稳定
- 实操:Veo / Runway / Sora,迈过三道门槛
- 进阶:多模型工作流与避坑
一、为什么第一篇要先讲边界和合规
一般的教程都是先教你出成果,最后附一段免责声明。这个系列反过来。
原因很实际:
- 在中国发布 AI 生成的视频,已经是有法可依的强制要求,不是建议。《人工智能生成合成内容标识办法》2025-09-01 已经施行,明确覆盖视频。
- 你用哪个付费档生成的视频,直接决定它能不能商用,而且很多平台不能追溯补授权。
- **有些坑是不可逆的。**用 AI 换上某个真人的脸发出去,删掉不等于没发生过。
换句话说,这些边界不影响你「做得好不好」,它影响的是「能不能发」。等你花一周做出一段很满意的视频,再回头发现发不出去,那一周就白花了。
所以:先花 30 分钟把边界搞清楚,再动手。
二、先把期待值校准到 2026 的真实水平
高估它你会失望,低估它你会错过。动手前先看清它现在到哪了。
2.1 三年时间它走到了哪
2023 年:能出 2~4 秒的片段,画面会「糊」和扭曲,人物一动就变形。那时候它的定位是玩具,不是工具。
2025 年:能出 5~10 秒、画面稳定的镜头,物体运动基本符合物理,短视频空镜够用,但细看仍有「AI 味」。这一年开始有人真的拿它做商用素材。
2026 年(现在):单段能到 10~25 秒,画面接近实拍,能指定运镜和风格,部分工具(如 Google Veo)能直接生成带同步声音的视频,还能把剧本一键拆成多镜头短剧。影视和广告行业已经在实际生产里用它了。
2.2 它现在仍然搞不定的几件事
这几条是硬边界,2026 年 7 月依然成立:
- **长视频。**单次生成通常只有 5~25 秒,一条完整片子要一段段拼。
- **精确文字。**画面里出现的招牌、字幕、logo 经常是乱码,别指望它写对字。
- **复杂的手部和多人互动。**手指数量、握手、递东西这类动作容易穿帮。
- **100% 可控。**你脑子里的分镜,往往要生成好几次才碰到满意的一版。
- **两次生成完全一致。**同样的输入,两次结果不一样,这是设计如此,不是 bug。
2.3 所以正确的用法是「大量生成、你来挑」
这是全系列最重要的一条心智模型,现在就要建立起来。
新手最常见的错误是:生成一次 → 觉得不太对 → 疯狂改提示词 → 再生成 → 还是不对 → 继续改。这条路走不通,因为结果本身就有随机性,你改的那个词可能根本不是变差的原因。
正确的姿势是:写一段还不错的描述 → 一口气生成好几版 → 挑一版最接近的 → 在这一版基础上继续。
你的角色更接近导演和制片——核心能力是「看得出哪版更好」,而不是「改得动某一帧」。
三、一段 AI 视频是怎么被造出来的
这一节是原理,不影响你操作。只想赶紧出片的话,可以直接跳到第四章,等你开始好奇「为什么它不听我的」时再回来。
3.1 把它想成一次翻译,而不是一次拍摄
最有用的类比是:它不是在拍摄,它是在做翻译。
你给它一句中文描述,它要把这句话翻译成一段会动的画面。中间大致有三步:
- 第一步:你写的那句话。比如「一只猫在雨中奔跑,镜头缓慢平移」。这是整条链路里唯一你能控制的地方。
- **第二步:模型把它翻译成一份条件清单。**速度多快、镜头怎么动、光线什么色调、主体长什么样——你的每个词都会变成清单上的一条;你没写的部分,清单上就是空的,由它自己填。
- **第三步:一帧一帧生成画面,再连成视频。**它参考前面已生成的画面往下接,同时对照那份条件清单,保证动作连贯。
第二、三步全部发生在云端,你看不见也改不了。(你可能听过 diffusion、transformer 这类词,它们描述的是第二三步的实现方式,对你写提示词没有帮助,这篇不展开。)
3.2 关键推论一:描述越具体,它还原得越准
这是本章最重要的一句话,也是整个系列的地基。
- 描述具体 → 条件多 → 它自由发挥的空间小 → 结果稳定、接近你要的
- 描述抽象 → 条件少 → 它自由发挥的空间大 → 结果基本靠运气
它自己填空时用的是「最常见的那种做法」,加一点随机。所以「一只可爱的猫」会得到一只随机的猫,而「一只橘色短毛猫,在雨夜的便利店门口,缓缓回头,霓虹灯反光,电影感」会得到接近你脑海的画面。
这就是为什么提示词值得单独写一整篇(第三篇)。它不是玄学,是在补条件清单上的空格。
3.3 关键推论二:一帧崩坏会拖累整段
第三步是「一帧一帧往下接」,每一帧都参考前面。于是某一帧生成得不好,后面会基于这个坏结果继续接。你会遇到:动到一半突然变形、镜头莫名其妙抽搐、物体凭空出现或消失。
这些不是你写错了提示词,是概率。同一段描述再生成一次,很可能就正常了。所以遇到画面崩,第一反应应该是重新生成,而不是改提示词。改提示词是用来调方向的,不是用来修 bug 的。新手最容易浪费额度的地方就在这里。
四、三大流派:三种把想法喂给 AI 的方式
AI 生视频按输入什么分成三类,这是整个领域最重要的分类。
- 文生视频(Text→Video):给一段文字。最自由,从零开始,但也最难控制,翻车率最高。
- 图生视频(Image→Video):给一张图 + 想要的动作。画面「有什么」已经定死,AI 只负责让它动。最可控,新手首选。
- 视频生视频(Video→Video):给一段已有视频 + 风格要求。用于改风格、换背景、二次创作。
4.1 新手为什么优先图生视频
因为文生视频里,画面里的一切都由 AI 随机决定;而图生视频里,你先有一张确定的图,AI 只需要解决「怎么动」这一个问题。变量少一个数量级,成功率高得多。
实操建议:**先用 AI 画图或自己拍一张满意的图,再喂给视频工具让它动起来。**这条路线贯穿后面所有实操篇。
五、能力与成本的现实(截至 2026-07-23)
这一节的价格与额度保质期约一个季度,正式使用前请以各家官网当前政策为准。详细横评在第二篇。
5.1 大多数工具靠「积分」计费
你每生成一次扣一些积分,清晰度越高、时长越长扣得越多。免费额度通常每天回血,够练手,但常带水印、且默认无商用权。
心态:**积分是消耗品。**先用低配、短时长把提示词调对,定稿了再用高配出终版——这是省钱也降低翻车的通用做法。
5.2 几个必须先认识的名词
| 名词 | 大白话 |
|---|---|
| 时长 / Duration | 视频多少秒,通常 5~25 秒起步 |
| 分辨率 / Resolution | 清晰度,720p < 1080p < 4K,越高越清越贵 |
| 帧率 / FPS | 每秒多少画面,越高越流畅(24 / 30 / 60fps) |
| 提示词 / Prompt | 你写给 AI 的那段描述,好坏直接决定成片(第三篇专讲) |
| 运镜 / Camera Move | 推、拉、摇、移等镜头运动,可在提示词里指定 |
| 一致性 / Consistency | 同一角色、场景跨镜头保持不变的能力 |
| 种子 / Seed | 一个随机数,固定它可以复现「同款」结果 |
| 积分 / Credits | 多数工具的货币,生成一次扣一些,每天回血 |
| 首尾帧 / First-Last Frame | 给开始和结束两张图,AI 补中间过渡(第五篇讲) |
| 数字人 / Digital Human | 会说话的虚拟人,用于口播视频 |
六、动手前的三条红线
从这里开始是合规。这一章的信息保质期同样只有一个季度左右,日后以各家官网和法规原文为准。
6.1 红线一:能商用 ≠ 有版权
多数人的默认理解是「我付了钱、用工具做的,那就是我的」。在 AI 生成内容这里,这个理解要打个问号。
- 商用授权 = 你可以拿它去卖钱、发行、接商单。付费档通常给你这个。
- 著作权 = 别人未经许可用了你的东西,你能告他。100% 由 AI 生成的内容,能否登记版权,各国规则不一,很可能拿不到完整著作权。
两个特别容易踩的坑:
- 授权多半不能追溯。不少平台要求你在生成那一刻就是付费用户,这段视频才带商用授权。免费玩很久、觉得某条特别好、这时再订阅——那条大概率补不了授权。有商用打算,就从第一次生成开始用付费档。
- **免费档做的视频拿去商用,是直接违约。**发行/接单环节你拿不出授权凭证。
怎么让作品尽量「是你的」:你在里面的人类创作成分越多(脚本自己写、分镜自己定、后期剪辑自己做),越站得住。这条思路是通用的降低风险做法,不构成法律意见,涉及金额较大的商用请咨询专业人士。
6.2 红线二:中国的标识办法已经生效(2025-09-01 施行)
《人工智能生成合成内容标识办法》由四部门联合制定,2025-03-14 发布、2025-09-01 施行,管辖范围明确包括视频。这是国家法规,不是平台规则。
落到视频上,大致是三件事:
- 画面/文件要有显式标识——用户能明显看到的提示(如画面角标「AI 生成」)。
- 文件元数据要有隐式标识——藏在文件里、机器可读的技术标记。
- 发布时要主动声明——用平台提供的「AI 生成」标签勾选声明。
办法同时禁止恶意删除、篡改、伪造、隐匿标识,也禁止为他人提供去标识的工具。所以不要去搜「怎么去掉 AI 标识」,那条路本身就在禁止范围内。
平台侧的具体处罚力度(限流、下架、封号)多来自二手合规解读,各平台官方规则原文本篇未逐一核实。能确认的是:主流平台的上传流程里都已有「AI 内容」标签选项。完整加标识步骤在第七篇。
6.3 红线三:别克隆真人的脸和声音
这条后果最重。视频比音乐更敏感,因为它同时涉及肖像和声音两种人格权。
- 中国法下,自然人的肖像和声音都受人格权保护(《民法典》人格权编,具体条号本篇未逐字核对,标注为未查证;原则本身清楚:未经许可使用他人肖像或声音,可能构成侵权)。
- 用 AI 把某个明星的脸换到视频里、或克隆某人的声音配音,即使标注了「AI 生成」,也不能免除侵权责任。标识解决的是「透明」,不解决「你有没有权利用这个素材」,这是两件独立的事。
- 开源工具在本地跑不改变行为性质,侵权看你发了什么,不看在哪台机器上做的;开源许可通常写明「作者不承担任何责任」,出事全部由使用者承担。
想要真人出镜怎么办:用工具自带的、已授权的数字人形象,或者用你自己的脸和声音。这两条路径在实操篇里会讲。
一句话总结:你可以让 AI 生成「某种长相、某种嗓音」的人,不能生成「某个具体的人」。
七、你适合做哪一档
三条红线讲完,最后帮你决定后面读什么。按目的分三档,读的内容完全不同。
- 玩票档(做给自己和朋友看,不公开发):读篇一 + 篇四就够。三条红线里你只要在意红线三——别克隆真人,哪怕只是发给朋友。成本可以完全免费。
- 配乐/素材档(给自己的短视频、店铺、播客做画面):读篇一 → 二 → 三 → 四(或五)。红线一(从第一次就付费档)和红线二(发国内平台就要标)要认真读。
- 发布档(真的要发到平台、可能赚钱):七篇全读,尤其篇六(国外工具)和篇七(合规与工作流)。三条红线全部适用,脚本和后期尽量自己做,增加人类创作成分。
如果还不确定,就按这个顺序:读篇四,做一段视频出来,再决定。大部分人做完第一条之后,对自己想去哪一档会突然变得很清楚。
八、翻车速查(认知层)
这一篇没有操作,所以这里列的是认知层面的翻车——它们都会造成真实损失。
| 你以为 | 实际上 | 后果 |
|---|---|---|
| 付了钱做的视频就是我的作品,有完整版权 | 你拿到的是商用授权,不一定是著作权;纯 AI 生成能否登记版权各国不一 | 别人用了同款画面,你可能告不赢 |
| 先免费玩,做出好片再订阅补授权 | 授权多半不能追溯,要在生成那一刻就是付费用户 | 最满意那条拿不到商用授权 |
| 标了「AI 生成」就免责了 | 标识解决透明度,不解决素材权利;换真人脸仍侵犯肖像权 | 责任一项都跑不掉 |
| 加标识是平台的事,我导出就完事 | 发布时应当主动声明,删改标识是明令禁止 | 平台限流下架,且属违规 |
| 在本地用开源工具换脸,没人知道 | 侵权看行为不看运行环境,开源不提供任何法律保护 | 出事全部自己承担 |
| 画面崩了,是我提示词写错了 | 那是概率,不是描述错误 | 越改越乱,白烧额度 |
| 同样的描述再来一次能得到一样结果 | 结果本身有随机性 | 期待错位 |
| 让画面出现指定的招牌字 | 模型不擅长精确文字,多半是乱码 | 白费,改用后期加字幕 |
一句话概括:几乎所有翻车,都来自把 AI 视频当成「我的作品加速器」,而不是「一个有明确边界的授权工具」。
九、下一步
9.1 这一篇你应该带走的五句话
- 它不是在拍摄,是在按你的描述还原画面——所以描述越具体,还原越准。
- 画面崩是概率,不是你的错——第一反应是重新生成,不是改提示词。
- 三大流派里,新手优先图生视频——先有确定的图,再让它动,最可控。
- 能商用 ≠ 有版权,而且授权多半不能追溯——有商用打算就从第一次生成开始付费。
- 别克隆真人的脸和声音——想要真人出镜,用授权数字人或你自己。
9.2 接下来读哪一篇
第二篇会把国内外主流工具摆上台面,配一张选型决策树,帮你 30 秒选出最适合自己的那一个。
如果你只想赶紧动手,也可以直接跳到 第四篇,用最易上手的小云雀做出第一段视频。
9.3 这一篇的保质期
- 第二、三章(能力边界与原理):一年以上有效。
- 第五章(价格与积分机制):保质期约一个季度,以各家官网为准。
- 第六章(标识办法条文):部门规章短期不会改;但配套细则和平台执行会变。红线一、三的授权与法律部分,正式商用前请现场复核。
本篇所有事实的抓取日期均为 2026-07-23。凡标注「二手」或「未查证」的内容,请勿直接当作依据使用。
留言功能暂时不可用,请稍后再试。