L O A D I N G
↓ 向下滚动进入
ORIZURU

AI 写歌到底是怎么回事:动手之前必须先搞懂的原理和三条红线

这篇假设你完全没做过音乐,不懂乐理,也不写代码。你只需要会用浏览器。 这一篇不需要动手,一个软件都不用装,一分钱都不用花。全文约 40 分钟。 第二章讲原理,只想赶紧出歌的人可以先跳过;但第四、五、六章不要跳,那三章决定的不是你做得好不好,而是你做出来的东西能不能发。

这是 AI 音乐系列六篇的第一篇:

  1. 本篇——AI 写歌到底是怎么回事:动手之前必须先搞懂的原理和三条红线
  2. Suno 保姆级教程:从注册到你的第一首完整歌曲
  3. 让 AI 听懂你要的那个味道:音乐提示词进阶
  4. 把 AI demo 变成能听的成品:分轨、人声、混音母带
  5. 不只有 Suno:AI 音乐工具全景与本地部署
  6. AI 音乐怎么合法地发出去:标识、平台政策与上架流程

为什么第一篇要先讲合规

一般的教程都是先教你出成果,最后附一段免责声明。这个系列反过来。

原因很实际:

  • 在中国发布 AI 生成的音频,已经是有法可依的强制要求,不是建议。《人工智能生成合成内容标识办法》2025-09-01 已经施行。
  • **你用哪个付费档生成的歌,直接决定这首歌能不能商用,而且不能追溯。**先做完再补订阅这条路是走不通的(详见第四章)。
  • **有些坑是不可逆的。**克隆一个真人歌手的声音发出去,删掉不等于没发生过。

换句话说,这三条红线不影响你”做得好不好”,它影响的是”能不能发”。等你花了一个月做出一首自己很满意的歌,再回头发现发不出去,那一个月就白花了。

所以:先花 30 分钟把边界搞清楚,再动手。


零、先看能力边界

动手之前,先把期待值校准到 2026 年的真实水平。高估它你会失望,低估它你会错过。

AI 生成音乐现在能做到哪一步三个时间点的能力对照,先把期待值校准2023 年2025 年2026 年 现在30 秒器乐片段有音色没结构两三分钟完整歌有主歌有副歌整首结构完整能指定编制年代人声几乎不能用中文人声能听清偶尔会唱崩人声接近可用仍要挑版本只能当素材不能当作品配短视频够用细听有塑料感能分轨导出进 DAW 精修圈内玩具开始有人拿去发行唱片公司下场谈判但它仍然不会:复现你脑子里的旋律、按小节改一个音、保证两次生成完全一致所以正确用法是「大量生成、你来挑」,不是「一次生成、反复改」

0.1 三年时间它走到了哪

2023 年:能出 30 秒左右的器乐片段,音色是对的,但没有结构——听不出哪里是主歌哪里是副歌。人声基本不能用。那时候它的定位是素材,不是作品。

2025 年:能出两三分钟的完整歌曲,有主歌有副歌,中文人声能听清词,偶尔会唱崩。配短视频已经够用,但细听有一层”塑料感”。这一年开始有人真的拿它去发行。

2026 年(现在):整首结构完整,你可以指定编制和年代。人声接近可用,但仍然要在多个版本里挑。能把歌拆成人声轨和伴奏轨导出,拿进后期软件里精修。唱片公司已经下场谈判——这本身就是它成熟度的证明。

0.2 它现在仍然不会的三件事

这三条是硬边界,2026 年 7 月依然成立:

  • **复现你脑子里的旋律。**你哼一段想让它照着写,做不到(部分产品有”哼唱输入”功能,但那是给它一个大致方向,不是精确复现)。
  • **按小节改一个音。**你没法说”第二段第三小节那个音高了,降半度”。它没有这个粒度的编辑能力。
  • **保证两次生成完全一致。**同样的输入,两次结果不一样,这是设计如此,不是 bug。

0.3 所以正确的用法是”大量生成、你来挑”

这是全系列最重要的一条心智模型,现在就要建立起来。

新手最常见的错误是:生成一次 → 觉得不太对 → 疯狂修改提示词 → 再生成一次 → 还是不对 → 继续改。这条路走不通,因为结果本身就有随机性,你改的那个词可能根本不是变差的原因。

正确的姿势是:写一段还不错的描述 → 一口气生成好几版 → 从里面挑一版最接近的 → 在这一版的基础上继续

你的角色更接近制作人和 A&R(唱片公司里负责挑歌、挑艺人的岗位),而不是作曲家。你的核心能力是”听得出哪版更好”,不是”改得动某一个音”。

0.4 这一篇里会出现的那首歌

全系列围绕同一首歌推进,歌名叫**《末班地铁》**,一首中文都市民谣。

先说清楚它的边界:**这首歌的歌词是人写的,AI 负责的是编曲和演唱。**这个系列不会教你”一句话全自动出一首好歌”,因为那个东西现在不存在。

这一篇里它只客串一下,用来举例子。它真正诞生是在第二篇。


一、AI 生成音乐和 AI 画画不是一回事

很多人是从 AI 画画那边过来的,会自然地套用画图的经验。这会让你在两个地方摔跤。

1.1 图是空间的,音乐是时间的

一张图,你的眼睛是一次性看完的。角落里有一根手指画歪了,你可能压根不会注意到;就算注意到了,你也可以只重画那个角落。

一首歌,你的耳朵是一秒一秒听完的。它必须从头到尾按顺序发生,而且:

  • 你不能跳过中间那一秒
  • 中间那一秒唱崩了,你一定会听见
  • 而且它会把前后几秒的听感一起拖下水

**图的错误是局部的,音乐的错误是全局的。**这是两者最本质的差别。

1.2 所以”局部重画”这招在音乐里很难使

AI 画图里有一个特别好用的功能叫局部重绘:框住画错的地方,只重新生成那一小块,其余部分原样保留。

音乐里没有真正等价的东西。原因是:一段音频的第 47 秒不是独立存在的,它承接着前面的和弦走向、鼓点位置、人声气口。你把这三秒单独换掉,接缝处几乎一定会露馅。

现在的产品(比如 Suno 的段落替换)提供的是按段落重做——重做整个副歌,而不是重做副歌里的某一句。粒度差着一个数量级。

结论:不要指望”哪里不好改哪里”。要么整段重来,要么换一版。

1.3 第二个差别:它的输出没有”图层”

画图工具至少还能导出分层文件。音乐生成出来的是已经混好的一整段音频——人声、吉他、鼓、贝斯全糊在一起。

后来出现的”分轨”功能(把一首歌拆成人声轨、伴奏轨等)是事后拆,不是生成时就分开的。事后拆一定有损失,拆出来的人声可能带一点混响尾巴或者”水声”。第四篇会详细讲这件事。

所以你拿到的是一个已经定型的成品,不是一堆可以自由重组的零件。这决定了你对它的控制方式只能是”生成前描述清楚”,而不是”生成后慢慢调”。

1.4 唯一的好消息

音乐比画图更容易”及格”。

一张画得平庸的图,一眼就看出来平庸。一首编曲平庸但音色干净、结构完整的歌,配上你自己写的词,在大多数使用场景里(短视频背景、个人作品、送人的生日歌)是完全够用的。

音乐的下限比图像高。这也是为什么现在拿 AI 音乐做实用产出的人比想象中多。


二、一首 AI 歌是怎么被造出来的

这一节是原理,不影响你操作。只想赶紧出歌的话,可以直接跳到第三章,等你开始好奇”为什么它不听我的”的时候再回来。

从一句话到一首歌,中间发生了什么把它想成一次翻译,而不是一次作曲你写的一句话深夜 都市民谣男声 木吉他模型把它翻译成一组可执行的条件按条件一段一段生成音频的碎片声码器把碎片还原成真实的波形一首能听的歌你唯一能控制的就是这里这三步在云端发生,你看不见也改不了结果有随机性所以要抽卡关键推论一:它不是在「作曲」,是在「按描述还原一段像那样的音频」所以描述得越具体,它还原得越准;描述得越抽象,它越靠随机关键推论二:音乐是时间序列,一秒钟的错误会毁掉整首这就是为什么它偶尔会唱崩、会突然断掉——不是你写错了,是概率

2.1 把它想成一次翻译,而不是一次作曲

最有用的类比是:它不是在作曲,它是在做翻译

你给它一句中文描述,它要把这句话翻译成一段音频。中间大致有四步:

第一步:你写的那句话。比如「深夜 都市民谣 男声 木吉他」。这是整条链路里唯一你能控制的地方

**第二步:模型把它翻译成一组可执行的条件。**这里的”条件”你可以理解成一份约束清单:速度大概多少、用什么乐器、人声是什么质地、情绪往哪个方向走。你的每一个词都会变成清单上的一条或几条;你没写的部分,清单上就是空的。

**第三步:按条件一段一段生成音频的碎片。**它不是一次性吐出整首歌,而是像写文章一样,一小块一小块往下接,每一块都要参考前面已经生成的内容,同时对照那份条件清单。

**第四步:声码器把碎片还原成真实波形。**声码器这个词的意思是”把压缩过的声音表示还原成你耳朵能听的声音”——有点像把一份压缩包解压成音频文件。这一步决定了最终听感的清晰度和”塑料感”程度。

第二到第四步全部发生在云端,你看不见也改不了

(你可能在别处看到过 transformer、diffusion 这类词,它们描述的是第二到第四步的实现方式。知道它们对你写提示词没有任何帮助,这篇不展开。)

2.2 关键推论一:描述得越具体,它还原得越准

这是本章最重要的一句话,也是整个系列的地基。

回到”翻译”这个类比。假设你请一个翻译把一句话翻成外语:

  • 你说「翻得好听一点」——他不知道你要什么,只能凭自己的口味发挥
  • 你说「翻成 1930 年代的书面语,句子短,别用外来词」——他能翻得很接近你要的

生成音乐是同一件事。你的描述会变成条件清单上的条目,清单上没写的部分,模型就自己填。它自己填的时候用的是”最常见的那种做法”,加上一点随机。

所以:

  • 描述具体 → 条件多 → 它的发挥空间小 → 结果稳定、接近你要的
  • 描述抽象 → 条件少 → 它的发挥空间大 → 结果基本靠运气

举个对照。同样是想要一首深夜感的中文民谣:

写得抽象:一首好听的中文民谣
写得具体:中文都市民谣, 男声, 木吉他分解和弦, 电钢, 轻柔鼓刷,
          慢速, 深夜感, 温暖干净的制作, 微微沙哑的气声

第二段就是《末班地铁》实际用的描述。它比第一段多给了七类信息:地域、流派、编制、速度、情绪、人声特征、制作质感。每多一类,模型的自由发挥就少一块。

这就是为什么提示词值得单独写一整篇(第三篇)。它不是玄学,它是在补条件清单上的空格。

2.3 关键推论二:一秒钟的错误会毁掉整首

第三步是”一小块一小块往下接”,每一块都要参考前面的内容。这带来一个必然的后果:

某一块生成得不好,后面的块会基于这个不好的结果继续往下接。

于是你会遇到这些现象:

  • 唱到一半突然咬字含糊,然后一路含糊到底
  • 副歌开始时和声突然歪了
  • 结尾没有收,直接断掉
  • 中间莫名其妙插进来一段不该有的乐器

这些不是你写错了提示词,是概率。同一段描述再生成一次,很可能就正常了。

这条推论直接决定了操作方式:**遇到唱崩,第一反应应该是重新生成,而不是改提示词。**改提示词是用来调整方向的,不是用来修 bug 的。

新手最容易浪费点数的地方就在这里——把一次随机失误当成描述错误,然后越改越乱。

2.4 顺带解释一个常见困惑

“为什么我和别人写了差不多的描述,出来的歌听着很像?”

因为条件清单相似,模型填空的方式也就相似。Suno 的服务条款里明确写着:输出在用户之间可能不唯一,别人可能拿到相同或相似的结果(suno.com/terms,最后修订 2026-03-26)。

这不是巧合,是这类工具的固有属性。第四章讲版权的时候,这一点还会再出现一次。


三、为什么提示词这么写才有效

上一章讲了”描述会变成条件”。这一章讲哪些描述能变成条件,哪些变不成

它听得懂什么,听不懂什么写提示词之前,先搞清楚哪些词是有效的听得懂 可以放心写听不懂 写了也白写流派:民谣 / citypop / 硬摇滚好听、高级、有质感乐器:木吉他 / 电钢 / 弦乐像周杰伦、像某某歌手年代与地域:90 年代日本第二段第三小节改一下情绪与场景:深夜、通勤路上副歌要更炸一点人声特征:男声、气声、慵懒和上一版保持一致规律:能翻译成声音特征的词有效,表达主观评价和指名道姓的词无效(后者还会踩红线)

3.1 一条规律就能概括

能翻译成声音特征的词,有效;表达主观评价和指名道姓的词,无效。

后半句还有一层:指名道姓不仅无效,还会踩红线(第六章讲)。

3.2 它听得懂的五类词

  • 流派:民谣、citypop、硬摇滚、trap、bossa nova。流派是最强的一类词,因为一个流派名字里打包了速度、编制、节奏型、混音风格一大堆信息。
  • 乐器:木吉他、电钢、弦乐、合成器 pad、鼓刷。写乐器等于直接指定编制。
  • 年代与地域:90 年代日本、80 年代英伦、当代中文。年代决定的是制作方式和音色审美,地域决定的是旋律走向和语言。
  • 情绪与场景:深夜、通勤路上、雨天、庆典。情绪词会影响和弦色彩和速度。
  • 人声特征:男声、女声、气声、慵懒、沙哑、高亢。

这五类词的共同点是:它们都能对应到实际的声音差异上。模型在训练时见过大量”这个描述配这种声音”的样本,所以它知道该怎么填。

3.3 它听不懂的四类词

  • 主观评价:好听、高级、有质感、专业、大气。这些词对应不到任何具体的声音,模型只能当噪音处理。
  • 指名道姓:像周杰伦、像 Taylor Swift、某某歌手的风格。这类词多数产品会直接过滤或忽略,而且——这是红线,第六章会讲清楚为什么不能这么用
  • 精确的位置指令:第二段第三小节改一下、把 1 分 20 秒那个音去掉。它没有这个粒度。
  • 跨次一致性要求:和上一版保持一致、只改这一处别动其他的。每次生成都是独立的,它没有”上一版”的概念。

3.4 一个常见的自我检验方法

写完描述之后,逐个词问自己一句:“这个词能对应到一种具体的声音吗?”

  • “沙哑” → 能,那是一种嗓音质地 → 留着
  • “温暖干净的制作” → 能,那是一种混音取向 → 留着
  • “高级” → 不能,什么声音算高级? → 删掉
  • “副歌要更炸一点” → 不能,“炸”是听感结果不是声音特征 → 改写成”副歌加入满编鼓组和电吉他”

这个检验做熟了,你的提示词水平就已经超过大多数人了。

3.5 这一节和第三篇的关系

这一章只讲了”哪些词有效”这个原则。真正的实操——怎么组合这些词、每个流派该配哪些词、结构标签怎么用、失败了怎么定位是哪个词的问题——在第三篇《提示词进阶》里。

这里你只需要记住那条规律:能翻译成声音特征的词才是词,其余都是噪音。


四、红线一:能商用 ≠ 有版权(截至 2026-07-23)

从这一章开始是三条红线。这三章的信息保质期只有一个季度左右,日后请以各家官网当前条款为准。

4.1 这是全篇最反直觉的一条

多数人的默认理解是:“我付了钱、用工具做的东西,那就是我的。”

在 AI 音乐这里,这个理解是错的。正确的表述是:

你拿到的是”商用授权”,不是”著作权”。

这两件事的差别是:

  • 商用授权 = 你可以拿它去卖钱、去发行、去接商单、去做广告配乐。
  • 著作权 = 别人未经许可用了你的东西,你可以告他。

AI 生成的音乐给你的是第一个,很可能给不了你第二个。

4.2 这不是我的解读,是工具方自己写的

Suno 的帮助中心页面(help.suno.com,查证于 2026-07-23)自己写得很清楚:

  • 免费档(Basic):Suno 是歌曲的所有者,用户只能非商业使用。
  • 付费档(Pro / Premier):你拥有歌曲,并获得商用授权。
  • 同一个页面上同时提醒:美国版权法只保护人类创作的内容,100% 由 AI 生成的音乐很可能不具备版权登记资格
  • 补充一句关键的:如果歌词是你写的,歌词部分归你。

最后那条很重要,第 4.5 节展开讲。

4.3 违反了会怎样

分三种情况:

**情况一:用免费档生成的歌拿去商用。**这是直接违反用户条款。后果不是”可能有点风险”,而是你从一开始就没有那份授权——发行商核查时可能拒绝上架或事后下架,平台可能撤下作品,如果是接的商单,客户追责时你拿不出任何授权凭证。

**情况二:以为自己有版权,去维权。**你发现别人在用一首和你几乎一样的曲子。你想告他,但你可能:(a)拿不到版权登记;(b)对方的曲子是他自己独立生成的,而工具方明说了输出可能不唯一。这种情况下你大概率告不赢。

**情况三:以为可以事后补授权。**详见下一节。

4.4 一个特别容易踩的坑:授权不能追溯

二手来源(Digital Music News 2025-12-22 对 Warner 协议后条款变化的报道)提到的一条规则是:订阅之后回头给之前生成的歌补商用授权 —— 不行。

翻译成人话:你必须在生成那一刻就已经是付费用户,这首歌才带商用授权。免费玩了三个月,觉得第 47 首特别好,这时候再去订阅——那首歌拿不到授权。

同一批报道还提到,Warner 协议之后 Suno 帮助页的标题从「Do I have the copyrights」改成了「Do I own the copyrights」,措辞从”你拥有歌曲”弱化成”你被授予商用使用权”。但本次调研抓到的帮助页仍然是旧措辞——说明这块正在反复改动。

所以这条的实操建议是:**如果你有任何商用打算,从第一次生成开始就用付费档。**不要先免费试,试爽了再订阅。

4.5 还有一个坑:Remix 是共同作品

Suno 服务条款(suno.com/terms,最后修订 2026-03-26)里另有一条,很多人没注意:

Remix 属于你和 Remixer 的共同作品。无论你是免费还是付费用户,Remix 只能用于合法的、内部的、个人的、非商业用途,并且必须署名 Suno。

也就是说:你拿别人公开的作品做 Remix,做得再好,都不能商用。这一点在第三篇讲局部返工的时候会再强调一次。

4.6 那怎么让作品尽量”是你的”

回到 4.2 最后那句:歌词由你写,歌词部分归你。

这给出了一条明确的提升路径。你在这首歌里的人类创作成分越多,你能主张的权利就越多:

  • 歌词自己写——这是最容易做到、贡献也最大的一步
  • 结构自己定——哪里是主歌哪里是副歌,段落顺序,由你安排
  • 后期自己做——分轨、混音、母带都是人类创作性劳动(第四篇)
  • 人声自己录或用自己的声音(第六章讲合规路径)

《末班地铁》就是这条路线:**歌词是人写的,AI 负责编曲和演唱。**这不是为了炫技,是为了让这首歌尽量站得住。

注意:不同国家的版权认定规则不同,中国的具体认定标准本文未做查证。上面这条”增加人类创作成分”的思路是通用的降低风险做法,不构成法律意见。涉及金额较大的商用,请咨询专业人士。


五、红线二:中国的标识办法已经生效(2025-09-01 施行)

上一条红线管的是”你有什么权利”。这一条管的是”你能不能发”。

在中国发布 AI 音乐,三件事是硬要求《人工智能生成合成内容标识办法》2025-09-01 起施行音频里的提示在音频起始或结束处加一段语音提示或特定节奏提示音文件里的标识导出的文件要带显式标识元数据要带隐式标识发布时的声明上传到平台时主动声明这是AI 生成内容并且:任何人不得删除、篡改、伪造、隐匿这些标识为什么这一条要放在第一篇因为它决定的不是「做得好不好」,而是「能不能发」。等你做完一首歌、交完订阅费,再回头发现发不出去,成本就白付了。完整的操作步骤在第六篇,这里只需要记住:发布不是导出就完事。

5.1 这是法规,不是平台规则

《人工智能生成合成内容标识办法》(国信办通字〔2025〕2 号),由国家网信办、工信部、公安部、广电总局四部门联合制定,2025-03-14 发布,2025-09-01 施行。原文在网信办官网可以直接查到。

请注意它和平台社区守则的区别:平台规则是平台定的,法规是国家定的。管辖范围包括文本、图片、音频、视频、虚拟场景——音频明确在内。

5.2 两个必须先分清的概念

办法把标识分成两类(第三条):

  • 显式标识:用户能明显感知到的提示。对音频来说,就是一段语音提示或者一段特定的节奏提示音。
  • 隐式标识:藏在文件数据里的技术性标记,人听不见,机器读得到。

这两个都要有,不是二选一。

5.3 落到音乐上,是三件事

第一件:音频里要有提示。

第四条第(二)项要求:音频应在起始、末尾或者中间适当位置添加语音提示或者音频节奏提示等标识,或者在交互场景界面中添加显著的提示标识。

第二件:导出的文件要带标识。

第四条末款:服务提供者提供下载、复制、导出功能时,必须确保文件中含有符合要求的显式标识。

第五条:还要在文件元数据里添加隐式标识,包含内容属性、服务提供者名称或编码、内容编号。办法同时鼓励加数字水印。

第三件:发布时要主动声明。

第十条:用户发布时应当主动声明并使用平台提供的标识功能

对应的,第六条规定了传播平台(抖音、B 站、网易云这类)的义务:核验元数据里的隐式标识,核验到就加显著提示;用户自行声明的也加提示;没声明但检测到生成痕迹的,标为「疑似生成合成内容」。

5.4 违反了会怎样

办法第十条写得很直接:

任何组织和个人不得恶意删除、篡改、伪造、隐匿标识,也不得为他人提供此类工具或服务。

注意最后半句——提供去标识的工具本身也是违规的。所以不要去搜”怎么去掉 AI 标识”,那条路本身就在禁止范围内。

另有第九条:用户可以申请获取不含显式标识的内容(比如你要拿去做后期),但服务提供者必须在用户协议里明确你的标识义务和使用责任,并留存提供对象信息等日志不少于 6 个月

翻译成人话:你拿到无标识版本这件事,是有记录的,且责任转移到了你身上。

至于平台侧的实际处罚力度——限流、下架、封号——这类说法来自二手的合规解读文章,各平台官方规则原文本次未逐一核实。写这篇时能确认的是:主流平台的上传流程里都已经有 AI 内容标签这个选项。具体后果请以你要发布的那个平台的创作者规则页为准。

5.5 为什么这一条要放在第一篇

因为它决定的不是”做得好不好”,而是”能不能发”。

等你做完一首歌、交完订阅费,再回头发现发不出去,成本就白付了。

完整的加标识操作步骤在第六篇。这里你只需要记住一句:发布不是导出就完事。


六、红线三:别克隆真人歌手的声音(截至 2026-07-23)

这条红线是三条里后果最重的一条。前两条踩了通常是”发不出去”,这条踩了可能是”被起诉”。

6.1 明确的禁止

Spotify 在 2025-09-25 发布的 AI 音乐政策中,直接写道:未经授权使用 AI 克隆艺人声音,是对其身份的剥削,破坏其艺术性,威胁作品的根本完整性。

同一份政策里也说明:部分艺人可以选择授权自己的声音给 AI 项目,但选择权必须留在艺人手里

这条冒名(impersonation)政策当日立即生效,没有过渡期。(来源:Music Business Worldwide 对该政策的报道,2025-09-25。)

6.2 国内同样有法律风险

中国法下,自然人的声音受人格权保护——《民法典》人格权编规定声音参照适用肖像权保护的相关规定。

说明:具体条文编号本次未核对原文,这里标注为未查证。如果你要在正式场合引用条号,请自行到法律法规数据库核实后再用。这条原则本身是清楚的:未经许可使用他人的声音,可能构成侵权。

6.3 “AI 翻唱”是最危险的玩法

拿别人的歌 + 明星音色做 AI 翻唱,是网上传播最广、也最危险的一种玩法。它同时踩三条线:

  1. 录音版权——原始录音是有版权的
  2. 词曲著作权——词和曲各自有著作权
  3. 声音 / 人格权——被克隆的那个人的权利

关键在于:**标注「AI 生成」不能免除以上任何一项责任。**标识办法解决的是”信息透明”问题,不解决”你有没有权利用这些素材”的问题。这两件事是独立的。

(这条判断来自国内合规解读文章,属二手来源;但三项权利各自独立成立,是著作权法与人格权保护的基本结构。)

6.4 开源工具不提供任何保护

有人会想:用开源的音色转换工具在本地跑,没人知道。

这个想法有两个问题:

  • **本地跑不改变行为的性质。**侵权与否看的是你做了什么、发了什么,不是在哪台机器上做的。
  • **开源工具”免费”,但也不提供任何法律保护。**商业工具至少还有条款、有客服、有些企业档甚至提供法律赔偿保障;开源仓库的 LICENSE 通常会明确写”作者不承担任何责任”。出事全部由使用者承担。

6.5 那想要人声怎么办:两条合规路径

好消息是,合规路径是存在的,而且够用:

路径一:用工具自带的授权音色。

生成工具内置的歌手音色,是工具方已经处理好授权的。你在它给的音色库里挑,法律层面是干净的。

路径二:克隆你自己的声音。

这是最稳妥的一条。你自己的声音,你自己有完整的权利。

举例:Suno 在 2026-03-26 随 v5.5 上线了 Voices 功能——录制或上传自己的声音后,让它用你的嗓音演唱。同期还有 Custom Models(上传自己作品集里至少 6 首曲子,训练一个属于你的模型变体)。

第四篇只会讲这两条路径,不会给任何绕过手段。

6.6 一句话总结这一章

你可以让 AI 用”某种嗓音”唱歌,不能让 AI 用”某个人”的嗓音唱歌。

描述音色特征(男声、沙哑、气声、高亢)是完全没问题的;指名道姓是有问题的。这也解释了第三章里为什么”像某某歌手”既无效又危险——它同时踩了两个坑。


七、这个领域正在被唱片公司改造(截至 2026-07-23)

这一章不是八卦,是给你一个心理预期:你今天学到的规则,半年后可能就变了。

2026 年,这个领域正在被唱片公司改造截至 2026-07-23 的格局,半年后大概率不一样Suno仍然是最好用的模型 v5.5和华纳等达成协议协议预告的规则变化尚未全部落地Udio已被环球、华纳收编作品至今不能下载原本的第二选择现在不能作为主力Riffusion已被 Google 收购域名跳转到Google Flow MusicSony唯一还没和解的大厂诉讼仍在进行结果会影响所有人给你的心理预期:今天教你的规则,半年后可能变。所以本系列把价格和政策单独成节,方便整节替换

这一整节的信息保质期最短。下面每一条都标了来源类型,凡标注”二手”的,请自行到一手页面复核

7.1 Suno:仍然最好用,但规则正在被改写

  • 当前主力模型 v5.5,发布于 2026-03-26(官方发布页与更新日志)。
  • 付费档可用 v4、v4.5、v4.5+、v5、v5.5;免费档只能用 v4.5-all(官方定价页)。
  • 华纳音乐集团(WMG)于 2025-11-25 与 Suno 达成和解并签署协议(二手:Music Business Worldwide)。

协议预告的变更(全部为二手来源,且截至 2026-07-23 尚未在官方定价页体现):

  • 免费档歌曲将不可下载,只能播放和分享
  • 下载需付费账号,且付费档会有每月下载次数上限,超出需另购
  • 新的”授权模型”上线后,现有模型将被弃用
  • 订阅之后回头给之前生成的歌补商用授权 —— 不行

**注意最后一条已经在第四章讲过,那是目前唯一已经在生效的一条。**其余三条属于预告,随时可能落地。

第二篇的档位介绍会单独成节,就是为了这一天到来时可以整节替换。

7.2 Udio:已被收编,至今不能下载

Udio 原本是 Suno 之外最主要的选择,现在处于”关门装修”状态。

  • 2025-10-29/30,环球音乐(UMG)与 Udio 和解,同时宣布共建授权平台,新平台计划 2026 年上线(一手报道:Music Business Worldwide,2025-10-30)。2025-11 中旬 WMG 也与 Udio 达成合作(二手)。
  • **和解当天 Udio 关闭了全部音频、视频、分轨的下载。**因用户强烈反弹,仅在 2025-11-03 至 11-05 开放了 48 小时下载窗口(二手:RouteNote)。
  • 截至 2026-07-23,下载仍未恢复,授权版新平台仍未公开上线。
  • 2026-07-17 Udio 宣布与 BuyDRM 合作做内容保护,进一步收紧(来源:Digital Music News,2026-07-17)。

结论:现阶段不建议把 Udio 作为主力工具——你的作品拿不出来。

它的定价档位本次未查到官方数字,二手来源的说法不予采信,本系列不写。

7.3 Riffusion:已被 Google 收购

  • 抓取 riffusion.com 与 producer.ai(2026-07-23),两个域名返回的是同一个页面,页面标题为「Google Flow Music」
  • 二手:Google 于 2026-02-24 收购 ProducerAI(由 Riffusion 更名而来),团队并入 Google Labs / DeepMind,产品改由 Lyria 3 驱动(musically.com,2026-02-25)。
  • 它的商用条款本次未查证(未抓到 Terms 页),所以本系列不对它的授权规则做任何判断。

7.4 Sony:唯一还没和解的大厂

在 RIAA 牵头的大厂诉讼中,UMG(2025-10 与 Udio 和解)、WMG(2025-11 与 Suno、Udio 和解)已经退出。索尼是唯一尚未和解的大厂(二手:Music Business Worldwide)。

这件事为什么和你有关:**这场诉讼的结果会影响所有人可以用什么、怎么用。**如果和解,格局大概率继续沿着”授权化”走;如果打到判决,结论会成为整个行业的基准线。

另外一条值得注意:美国音乐家工会 AFM 已起诉 UMG 与 WMG,指其与 Suno / Udio 的和解损害了乐手利益(Hollywood Reporter 报道)。也就是说,就算大厂之间谈妥了,创作者一侧的争议还在继续。

7.5 给你的心理预期

**半年后这一章大概率不一样。**具体来说,最可能变的是这几件事:

  • Suno 的下载规则和模型列表(协议已预告,随时落地)
  • Udio 是否恢复下载、授权版平台是否上线
  • 各平台的 AI 披露机制(Spotify 的 AI Credits 仍在 beta,Apple 的透明度标签才上线几个月)
  • 所有工具的价格与额度

所以本系列的做法是:**把价格和政策单独成节,节标题带日期,方便日后整节替换。**你在读的时候也请注意这些日期——超过三个月的,请自行复核。

至于原理(第二、三章)和法规原文(第五章),这两块相对稳定,一年内不太会变。


八、你适合做哪一档

三条红线讲完了。最后帮你决定后面读什么。

按目的分三档,读的内容完全不同:

8.1 玩票档:做给自己和朋友听

特征:做生日歌、给自己的诗配曲、纯粹好奇、不发到公开平台。

你需要读:第二篇(做出第一首歌)就够了,第三篇看心情。

红线关注度:三条红线里,你只需要在意第六章那条——不要克隆真人歌手,哪怕只是发给朋友。前两条对你影响不大,因为你不商用、不公开发布。

成本:可以完全免费。

8.2 配乐档:给自己的视频、播客、店铺用

特征:短视频背景音乐、播客片头、直播垫乐、自己产品的宣传片。

你需要读:第二篇 + 第三篇 + 第五篇(第五篇里有专门讲授权更干净的纯 BGM 工具)。第四篇可以选读。

红线关注度

  • **第四章(能商用≠有版权)要读。**只要视频挂了广告、店铺在卖东西,你就算商用。从第一次生成就要用付费档。
  • **第五章(标识办法)要读。**发到国内平台就要标。
  • 第六章基本用不上,因为你多半做纯器乐。

成本:需要付费订阅,或者选一家授权路线更干净的 BGM 工具。

8.3 发行档:真的要把歌发到音乐平台上

特征:想上架网易云、QQ 音乐、Spotify,想有正式的作品,可能想赚点钱。

你需要读:六篇全读,一篇都不能跳。尤其是第四篇(后期)和第六篇(发行合规)。

红线关注度:三条全部适用,而且要求最严。补充两条:

  • 歌词一定自己写(第 4.6 节讲的理由)
  • 后期一定自己做,这既提升质量,也增加你的人类创作成分

成本:订阅费 + 可能的发行商年费 + 后期工具。第六篇会给一个诚实的收益预期——不画饼

8.4 如果你还不确定

那就按这个顺序:读第二篇,做一首歌出来,听完再决定。

大部分人做完第一首之后,对自己想去哪一档会突然变得很清楚。


九、翻车速查

这一篇没有操作,所以这里列的是认知层面的翻车——它们全部是真实会造成损失的误解。

你以为实际上后果
付了钱做出来的歌就是我的作品,有完整版权你拿到的是商用授权,不是著作权;100% AI 生成的音乐很可能不具备版权登记资格别人用了同款曲子,你告不赢
先用免费档玩,做出好歌再订阅补授权授权不能追溯,必须在生成那一刻就是付费用户你最满意的那首歌拿不到商用授权
免费档做的歌,自己视频里用一下没关系视频挂广告 / 店铺带货就算商用,免费档明确禁止商用违反条款,发行或商单环节拿不出授权
Remix 别人的作品做得好就能发Remix 属共同作品,无论付费与否都只能非商用,且须署名 Suno商用即违约
标注了”AI 生成”就免责了标识办法解决透明度,不解决素材权利;翻唱仍踩录音版权 + 词曲著作权 + 人格权三项责任一项都跑不掉
加标识是平台的事,我导出就完事了用户发布时应当主动声明;恶意删改标识是明令禁止的平台限流下架,且属违规行为
在本地用开源工具克隆声音,没人知道侵权看行为不看运行环境;开源不提供任何法律保护出事全部自己承担
写”像某某歌手”能让它更接近我要的风格这类词多数会被忽略或过滤,同时踩人格权红线白写,而且危险
生成的歌唱崩了,说明我提示词写错了那是概率,不是描述错误越改越乱,白烧点数
哪里不好改哪里,像 AI 画图那样局部重绘音乐是时间序列,最小编辑粒度是段落不是句子接缝一定露馅
同样的描述再来一次能得到一样的结果结果本身有随机性,输出在用户之间可能不唯一期待错位
国外平台的规则和国内一样中国有强制性法规,海外是平台政策,两套体系漏做国内的标识

一句话概括这张表:几乎所有翻车,都来自把 AI 音乐当成”我的作品加速器”,而不是”一个有明确边界的授权工具”。


十、下一步

10.1 这一篇你应该带走的五句话

  1. 它不是在作曲,是在按你的描述还原一段音频——所以描述越具体,还原越准。
  2. 唱崩是概率,不是你的错——第一反应是重新生成,不是改提示词。
  3. 能商用 ≠ 有版权——而且授权不能追溯,有商用打算就从第一次生成开始付费。
  4. 在中国发布 AI 音频要加标识——这是法规,2025-09-01 已经施行。
  5. 不要克隆真人歌手——想要人声,用授权音色或者你自己的声音。

10.2 接下来读哪一篇

下一篇:Suno 保姆级教程:从注册到你的第一首完整歌曲

第二篇会带你从注册开始,一步步做出一首两三分钟、有主歌有副歌、能下载的完整歌曲——就是这一篇里提到的那首《末班地铁》。里面会给出完整的风格描述和歌词全文,你可以原样复制,当场复现。

第二篇还会讲清楚这几件事:

  • 三个订阅档位的真实差别,以及三个必须先知道的坑
  • Simple 模式和 Custom 模式分别适合谁
  • Style / Lyrics / Title 三个框各管什么——这是绝大多数人用不好 Suno 的根本原因
  • 点数怎么花不浪费

如果你暂时不打算用 Suno(比如网络不方便,或者只想要纯器乐 BGM),可以直接跳到 第五篇:工具全景与本地部署,那里有一张按用途选工具的决策树,也讲了国内可以直接访问的产品和开源本地方案。

10.3 这一篇的保质期

  • 第二、三章(原理与提示词规律):一年以上有效。
  • 第五章(标识办法条文):部门规章,短期内不会改;但配套国标和平台执行细则会变。
  • 第四、六、七章(授权条款、平台政策、行业格局):**保质期约一个季度。**建议你每次要正式发布作品之前,回到各家官网现场核对一次。

本篇所有事实的抓取日期均为 2026-07-23。凡文中标注”二手”或”未查证”的内容,请勿直接当作依据使用。