L O A D I N G
↓ 向下滚动进入
ORIZURU

把 AI demo 变成能听的成品:分轨、人声、混音母带

这篇假设你已经能用 Suno 生成出一首自己还算满意的歌(篇二、篇三讲的事),现在想让它”听起来不像 AI 随手出的”。 你不需要懂乐理,不需要会看波形,也不需要买任何软件。全篇需要的只是耐心。

全文约 40 分钟。动手部分第一次做大约 1.5 小时,熟练之后一首歌半小时。 第四节(AI 母带)和第五节(导出规格)如果你只是自己听或者配自己的短视频,可以先跳过

这是 AI 音乐系列六篇的第四篇:

  1. AI 写歌到底是怎么回事:动手之前必须先搞懂的原理和三条红线
  2. Suno 保姆级教程:从注册到你的第一首完整歌曲
  3. 让 AI 听懂你要的那个味道:音乐提示词进阶
  4. 本篇——把 demo 变成成品
  5. 不只有 Suno:AI 音乐工具全景与本地部署
  6. AI 音乐怎么合法地发出去:标识、平台政策与上架流程

先说两个词,后面反复出现:

  • demo(小样)——能听出这首歌长什么样,但还没打磨过的版本。AI 直出的就是 demo。
  • 后期——歌已经录完之后做的那些事:拆轨、调音量、修音色、统一响度。本篇讲的全部是后期。

零、AI 出的歌为什么听着”糊”

AI 出的歌为什么听着糊四个听感差别,都不需要懂乐理就能听出来AI 直出的 demo做过后期的成品响度偏小和别的歌切换要调音量响度对齐平台标准和别的歌无缝衔接中频挤成一团人声和吉他黏在一起各占各的频段人声浮在最前面声场窄像从一个点里发出来有左右宽度戴耳机能听出空间动态忽大忽小动态稳,安静段落也听得清结论:后期能把 demo 抬高一档,但救不了一首生成得就不对的歌。先挑对版本,再做后期

0.1 先做一个 30 秒的实验

拿你最满意的那首 AI 歌,和你手机歌单里任意一首正经发行的歌,用同一个音量、连着切换播放

绝大多数人会立刻听出三件事:

  • AI 那首声音小一截,得手动往上推音量才够
  • AI 那首的人声像陷在伴奏里,词听得没那么清
  • AI 那首从左耳到右耳的宽度更窄,像所有声音都从中间一个点发出来

这三件事跟”旋律好不好听""AI 唱得像不像人”都没关系。它们是制作层面的差距,也正是后期能修的部分。

0.2 四个听感差别,一个个说

图里那四组对照,翻译成你能听出来的话:

一、响度偏小。 切到你这首歌,得把音量往上推两格。

  • 响度——一整首歌听起来”有多大声”的整体感觉,不是某一瞬间的峰值。AI 生成时不会替你考虑”这首歌要和几千万首已发行的歌放在一起”。

二、中频挤成一团。 人声和吉他黏在一起,你能听见有人在唱,但听不清在唱什么词。

  • 这里的”中频”你可以不管定义,只记听感:闷、糊、像隔了一层布。成因是人声和木吉他天然占同一段音高区间,谁也不让谁。

三、声场窄。 戴上耳机,所有乐器都挤在脑袋正中间。

  • 声场——闭上眼睛时,你感觉到的这支乐队摆得有多宽。

四、动态忽大忽小。 主歌太轻要凑近听,副歌一上来又突然吵。

  • 动态——一首歌里最轻的地方和最响的地方差多少。差太多就是”忽大忽小”。

0.3 后期能修多少,不能修多少

这是本篇最重要的一句话,图里也写了:

后期能把 demo 抬高一档,但救不了一首生成得就不对的歌。

具体点说:

后期修得了:

  • 响度不够、和别的歌切换要调音量
  • 人声被伴奏盖住、词听不清
  • 整首歌闷、糊
  • 主歌太轻副歌太吵
  • 结尾收得突兀(可以自己剪一个淡出)

后期修不了:

  • 旋律不好听
  • 唱词吐字含糊、把字唱错、唱出奇怪的音节
  • 编曲本身就单薄(只有两件乐器在那儿撑三分钟)
  • 副歌不炸——这是写出来的,不是调出来的
  • 风格跑偏(你要民谣它给你摇滚)

所以正确的顺序是:**先回篇二、篇三多抽几次卡,挑到一版你听三遍都不腻的,再开始做后期。**在一版本来就不行的素材上花两小时,是这件事上最常见的浪费。

0.4 这一节的结论

后期不是”让歌变好听”,是”让一首本来就还行的歌,不在别人的播放器里吃亏”。

期望值放在这里,后面每一步你都不会失望。


一、分轨:把一首歌拆成人声和伴奏

把一首歌拆成人声和伴奏,三条路截至 2026-07-23,计费方式请以各家官网为准Suno 自带LALAL.aiDemucs 本地不用离开 Suno跟着订阅走网页上传即可按用量付费开源 MIT 协议本地跑,免费可商用Pro 档 2 种分轨Premier 近 100 种乐器分轨类型多质量稳定质量接近商业方案但要装环境只能处理Suno 里的歌计费 = 时长 × 类型数最容易算错预算命令行第一次配置要花时间LALAL.ai 的算例,先算再买一首 3 分钟的歌,只要人声和伴奏 2 种 = 3 × 2 = 6 分钟额度同一首歌想拆成人声、鼓、贝斯、其他 4 种 = 3 × 4 = 12 分钟额度很多人按「几首歌」估额度,结果买少了一半

1.1 什么是分轨,为什么必须先做

分轨(stem separation)——把一首已经混好的歌,重新拆回成”人声一条、伴奏一条”这样的独立音轨。英文里每一条叫一个 stem。

为什么必须先做:没拆开之前,你什么都调不了。

  • 想把人声调大一点?没拆开,你只能把整首歌一起调大,人声和伴奏的比例纹丝不动。
  • 想把伴奏的浑浊感去掉?没拆开,你一动就把人声也一起削了。

拆开之后你才有两个(或更多)独立的东西可以分别处理。这就是后期的起点。

副产品也很有用:只要伴奏可以给视频配 BGM、做卡拉 OK 版;只要人声可以换一个伴奏、或者做一段清唱。

1.2 三条路怎么选(截至 2026-07-23)

图里给了三条路,各自的适用人群非常清楚:

  • 你已经订了 Suno 的付费档、歌也是 Suno 生成的 → 用 Suno 自带的,别折腾。
  • 你要处理的音频不在 Suno 里(比如别处生成的、或者自己录的)、又不想装软件 → LALAL.ai。
  • 你要长期做、量大、或者在乎成本和商用授权 → Demucs,本地跑,免费。

下面逐条说,价格与功能一律以调研当日抓取为准,具体条款请以官网当前页面为准

1.3 方案一:Suno 自带(截至 2026-07-23)

能力边界:

  • Free 档没有分轨功能,而且免费档明确禁止商用。要做后期,至少得是 Pro。
  • Pro 档 2 种分轨:Auto Split、Split from Mix。
  • Premier 档 3 种:多一个 Advanced Split。

三种模式各是什么(官方 release notes,2026-06-11 更新):

  • Auto Split——经典款,一次输出 12 类 stem。对小白来说这是默认选项。
  • Split from Mix——你指定抽出某一件乐器或人声,它给你两条轨:“它” + “其余全部”。想单独动人声时最省事。
  • Advanced Split——从近 100 种乐器里挑要拆什么。仅 Premier 档可用。

优点: 不用离开 Suno,不用上传下载,跟着订阅走,不额外花钱。

限制(图里标黄的那条): **只能处理 Suno 里的歌。**你在别处生成的、或者自己手机录的东西,进不来这条路。

1.4 方案二:LALAL.ai —— 计费方式最容易算错(截至 2026-07-23)

这是本节最需要你花两分钟看懂的地方。

它的档位(官网 pricing 页,2026-07-23 抓取):

  • Starter:永久免费,总共 10 分钟额度(一次性,不是每月)
  • Lite:约 $7.5/月
  • Pro:约 $15/月

年付折算价在页面上的表述本次抓取到的口径不一致,具体请以官网当前价格页为准

付费档的队列机制(这点很多人搞反):

  • 付费档 = Relaxed Queue 分钟数无限 + Fast Queue 固定额度
  • Fast Queue 额度:Lite 90 分钟/月,Pro 250 分钟/月
  • 两个队列分离质量完全一样,只差排队速度
  • 不能手动切换:每月先自动走 Fast,用完自动转 Relaxed
  • VST 插件、桌面端本地处理、API 仅 Pro 档

1.5 那个必须算的算例

计费公式:分钟数 = 文件时长 × 你要分离出的 stem 类型数。

注意是,不是加,也不是”一首歌算一次”。

算例一:一首 3 分钟的歌,只要人声和伴奏两种

3 分钟 × 2 种 = 6 分钟额度

算例二:同一首 3 分钟的歌,想拆成人声、鼓、贝斯、其他四种

3 分钟 × 4 种 = 12 分钟额度

同一首歌,什么都没变,只因为多勾了两个类型,额度消耗翻了一倍。

这个坑长什么样:

  • 免费档 10 分钟。你以为”够拆三首歌”。
  • 实际:第一首 3 分钟的歌拆 2 种,用掉 6 分钟,剩 4 分钟
  • 第二首同样长度同样拆法需要 6 分钟,不够了
  • 免费额度实际只够一首歌,加上一小段试验。

买 Lite 档的人也会犯同样的错:

  • Fast Queue 90 分钟/月,很多人心算”90 ÷ 3 = 每月 30 首”。
  • 每首拆 2 种,实际 90 ÷ 6 = 15 首
  • 每首拆 4 种,实际 90 ÷ 12 = 7 首多一点

按”几首歌”估额度的人,普遍会买少一半以上。 正确做法是先按”总时长 × 平均类型数”算一遍再决定档位。

一个缓解办法: 付费档的 Relaxed Queue 分钟数无限、质量完全一样。所以对付费用户来说,Fast 额度用完不等于不能干活,只是要排队等。真正被这个公式卡死的,是免费档用户

1.6 方案三:Demucs —— 免费、可商用、要用命令行

Demucs(开源,Meta 系,仓库 https://github.com/adefossez/demucs ):

  • MIT 许可,代码与项目均为 MIT
  • 本地跑、免费、可商用
  • 它是所有在线分轨服务的事实基线——很多商业服务底下跑的就是这一类模型

为什么值得推荐给认真做的人:

  • 没有分钟额度,没有类型数乘法,拆多少次都不要钱
  • 音频不上传到别人服务器
  • MIT 许可意味着商用没有授权障碍——这在整篇里是难得的、不会过期的确定性

代价(图里标黄的那条): 命令行,第一次配置要花时间。

最简路径(以仓库 README 当前说明为准,下面只是形状):

  1. 装 Python(3.9 以上),装的时候勾上”加入 PATH”
  2. 打开终端 / 命令提示符
  3. 装它:pip install -U demucs
  4. 拆一首歌:demucs 你的歌.mp3
  5. 等它跑完,在自动生成的输出文件夹里找到分好的几条 wav

第一次跑的三个心理准备: 首次运行会下载模型文件(几百 MB 起,要等);纯 CPU 也能跑,就是慢(一首 3 分钟的歌可能要十几分钟);报错基本都出在 Python 环境上而不是 Demucs 本身,把报错整段贴给 AI 问通常五分钟内能解决。

1.7 还有一个:Moises

Moiseshttps://moises.ai/ )官网确认有免费档(每月有限次上传 + 部分功能),完整价目表需登录后才可见——具体档位与价格本次未查证,请以官网当前条款为准

定位上它介于 LALAL.ai 和 Suno 之间:网页/App 操作,功能比纯分轨多。如果你想再多试一家,可以看它。

1.8 分轨这一步的验收标准

拆完之后,分别单独听一遍

  • 人声轨:听得清词,背景里有一点点伴奏残留是正常的
  • 伴奏轨:听不到明显的人声,偶尔飘过一点气声可以忍

如果人声轨里有明显的”水声""咕噜声""像在水下唱歌”,翻到第七节看修法。


二、人声这条线(含法律红线)

这一节先讲红线,再讲能做什么。顺序不能反。

2.1 红线:不要克隆真人歌手的声音

这不是建议,是明确的红线。

海外平台已经明文禁止。 Spotify 在 2025-09-25 的政策发布中直接写:未经授权使用 AI 克隆艺人声音,是对其身份的剥削,破坏其艺术性,威胁作品的根本完整性。Spotify 的冒名(impersonation)政策当日立即生效。同一份政策里 Spotify 也说明:部分艺人可以选择授权自己的声音给 AI 项目,“选择权必须留在艺人手里”

国内同样有法律风险。 中国法下,自然人的声音受人格权保护(《民法典》人格权编规定声音参照适用肖像权保护的规定)。

具体条文编号本篇不引用——调研时未核对原文条号,你如果要在正式文书里引用,请自行核实条号后再用

“AI 翻唱”是重灾区。 拿别人的歌 + 明星的音色做 AI 翻唱,同时踩三条线

  1. 录音版权
  2. 词曲著作权
  3. 声音 / 人格权

而且——标注”AI 生成”不能免除这三项责任。这是国内合规解读普遍强调的一点(二手来源)。

后果不是”被举报了删掉就行”:

  • 平台侧:下架、账号处罚,Spotify 的冒名政策是立即生效的那种
  • 民事侧:被克隆者可以主张人格权侵权
  • 如果你还拿它变现了,性质会更重

本篇不提供任何绕过手段,也不提供克隆他人声音的操作步骤。 开源工具确实存在(比如 RVC 这类音色转换项目),但开源”免费”不等于”合法”,它不提供任何法律保护,出事全部由使用者承担。这一点必须说清楚。

2.2 合规路径一:用工具自带的授权音色

这是最省事、最安全的一条。

它是什么: 工具方自己准备好、并且已经拿到授权的虚拟歌手音色。你只管选一个、给词、让它唱。

为什么安全: 声音的授权链条在工具方那边,不在你身上。

典型场景:

  • Suno 直接生成时,用 Style 框里的人声描述(比如贯穿案例里的”男声, 微微沙哑的气声”)——这本身就是在选授权音色,只是它不给你列表挑
  • 专业歌声合成软件里,选一个内置歌手

代价: 音色不是你说了算,你只能在它给的范围里挑,而且描述词是概率性的——同一句描述,两次生成可能给你两种嗓子。

2.3 合规路径二:克隆你自己的声音

这条路的核心前提只有一句:被克隆的人是你本人,你能对这份授权负责。

Suno 的 Voices 功能(官方 release notes,2026-03-26 随 v5.5 上线):

  • 录制或上传自己的声音,之后让 Suno 用你的嗓音演唱
  • 同批还上线了 Custom Models:上传自己作品集里至少 6 首曲子,训练一个属于你的 v5.5 变体

做这件事之前的三个提醒:

  • 只用你自己的声音。 用室友的、用某个视频里的、用你喜欢的歌手的——全部越线。
  • 看清工具的条款。 你上传的声音样本被怎么使用、能不能删除,各家写法不同,以官网当前条款为准
  • 录制质量决定上限。 安静的房间、离麦克风一拳距离、不要贴着手机吼。这一步糊了,后面全糊。

一个诚实提醒: 大多数人第一次听到”用自己声音唱的 AI 歌”会觉得别扭,因为你熟悉的是自己颅骨里听到的声音,不是别人听到的那个。这不是工具的问题,多听几遍就适应了。

2.4 专业歌声合成软件:只讲定位

如果你想更精细地控制每一个字怎么唱,有一类专门的软件,叫歌声合成——你输入歌词和旋律,它用虚拟歌手唱出来。

两个常被提到的:

  • Synthesizer V Studio 2 Pro(Dreamtonics):定位更像”可精细控制的 AI 歌手插件
  • ACE Studio 2:定位更像”一体化 AI 人声制作环境”,价格高一个数量级

两者的具体价格,调研时只拿到二手来源(搜索摘要与论坛),未核到官方商店页,本篇不写数字。请以各自官网为准。 上面的定位差异同样来自二手来源。

适合: 你已经会写旋律或能自己哼出来,且要的是”这一个字的尾音怎么收”这种级别的控制。

不适合: 只想让一首 AI 歌听起来更好——那不是它解决的问题,这一段你可以跳过


三、混音:只做三件事就够

混音只做三件事就够了剩下的一百个参数,现阶段全都可以不碰音量平衡人声比伴奏再大一点点判断标准手机外放能听清词去浑浊把 200 到 400 赫兹轻轻减一点判断标准不再有闷罐子感控动态给人声加压缩比例三比一起步判断标准轻声和重声一样清楚顺序很重要:先平衡音量,再去浑浊,最后压缩。顺序反了会反复推倒重来工具选择免费够用:Reaper 试用期无限、Audacity、GarageBand(macOS 自带)这一步的目标不是「专业」,是「不难听」。听三遍还挑不出毛病就可以收工了

3.1 先把期待放对位置

混音——把已经拆开的几条轨,重新调成一个好听的整体。

打开任何一个音频软件,你会看到上百个参数。现阶段你只需要动三个,图里那三个。剩下的全都可以不碰。

图里最下面那句话就是这一节的验收标准:

这一步的目标不是”专业”,是”不难听”。听三遍还挑不出毛病就可以收工了。

3.2 顺序不能反

图里标黄的那条最重要:

先平衡音量,再去浑浊,最后压缩。顺序反了会反复推倒重来。

为什么:

  • 你先去浑浊,再调音量——音量一变,刚才削掉的量又不对了,得重削
  • 你先压缩,再调音量——压缩的效果跟输入音量直接相关,音量一变,压缩全白调

顺序反了不会出错,只会让你把同一件事做三遍。

3.3 旋钮一:音量平衡

做什么:把人声调得比伴奏再大一点点。

  • 找到每条轨的音量推子(每个软件都有,长得像一根可以上下拖的滑杆)
  • 先把伴奏定在一个舒服的位置,再一点点往上推人声
  • “一点点”是真的一点点,推过头会显得人声浮在外面,跟伴奏脱节

判断标准(图里给的):手机外放能听清词。

这个标准比戴耳机严格得多,而且更接近真实收听场景——大部分人听你的歌就是拿手机外放。手机外放能听清,戴耳机一定没问题。

这一步做完的感觉: 你会发现”AI 歌听不清词”这个毛病,有一多半在这里就解决了。

3.4 旋钮二:去浑浊

做什么:把 200 到 400 赫兹轻轻减一点。

先解释这句话里唯一的术语:

  • 赫兹(Hz)——描述声音高低的单位。数字越小,声音越低沉;数字越大,声音越尖细。
  • 200 到 400 赫兹大致是”男声胸腔共鸣、木吉他箱体嗡嗡声”待的那一片。这一片东西堆多了,整首歌就闷。
  • EQ(均衡器)——一个可以”把某一片高低区间调大或调小”的工具。每个音频软件都有,通常就叫 EQ 或均衡。

怎么做:

  1. 在伴奏轨上找到 EQ / 均衡器
  2. 把频率设在 200–400 之间
  3. 轻轻往下减——减 2 到 3 个单位就够,不要减一半
  4. 来回开关这个 EQ,对比听

判断标准(图里给的):不再有”闷罐子感”。

“闷罐子感”就是那种整首歌像装在纸箱里放出来的感觉。减掉之后,人声会自己往前浮一层。

三个提醒: 只减不加(小白阶段加什么都是灾难);优先减伴奏不减人声(人声减多了会变薄变尖);减完觉得”变空了”就是减多了,往回退一半。

3.5 旋钮三:控动态

做什么:给人声加压缩,比例三比一起步。

  • 压缩器(Compressor)——一个”自动帮你压住太响的地方”的工具。你唱轻的时候它不管,唱重超过某个线之后它把超出的部分按比例压下去。
  • 三比一是压缩比例:超出的部分只让它长三分之一。这是最常用的温和设定。

怎么做:

  1. 在人声轨上找到压缩器
  2. 比例(Ratio)设成 3:1
  3. 慢慢往下调阈值(Threshold,就是”从多响开始压”那根线),直到你看到它在副歌时有一点点动作
  4. 压完整体会变小一点,用输出增益补回来

判断标准(图里给的):轻声和重声一样清楚。

也就是主歌你不用凑近听,副歌不用躲。

最容易犯的错: 压太狠。压过头的表现是整首歌像被按住了,没有起伏,副歌上来一点都不激动。宁可压得不够,也不要压过头。

3.6 用什么软件(图里给的免费选项)

图里给出的三个免费够用的选择:

  • Reaper(试用期无限)
  • Audacity
  • GarageBand(macOS 自带)

这三个是配图给出的选项。它们各自的授权条款、试用规则请以各家官网为准。

这类软件统称 DAW——数字音频工作站,就是”把多条音轨摆在一起编辑”的软件。

怎么挑: 用 Mac 又想快点做完选 GarageBand(开机就有);想要一个能长期用下去的选 Reaper;只想剪一剪、加个淡出,Audacity 就够。

本篇不给具体菜单路径。 各家 DAW 的菜单结构、版本差异都很大,写死了反而误导。你需要在界面上找的东西只有三个:音量推子、EQ、压缩器。这三个词在任何一个 DAW 里都存在,找不到就搜这三个词。

3.7 三个旋钮之外,唯一值得多做的一件事

给结尾加一个淡出。

AI 生成的歌经常收尾很突兀——上一秒还在唱,下一秒就没了。

做法:在最后两三秒把整体音量拉一条斜线到零。任何 DAW 都支持,通常叫 fade out 或淡出。

这一下的性价比,比你调半小时 EQ 都高。


四、AI 母带:能做多少,做不了多少

4.1 母带是什么

母带(Mastering)——把整首歌的音量和音色做最后一次统一,让它和别的歌放在一起时不吃亏。

注意和混音的区别:

  • 混音处理的是多条轨之间的关系(人声和伴奏谁大谁小)
  • 母带处理的是已经合成一条的整首歌(这一首和别人那一首比,够不够响、够不够亮)

母带是后期的最后一步。混音没做好,母带只会把问题一起放大。

4.2 诚实说明:母带救不了一首生成得就不对的歌

这句话必须放在工具介绍前面。

母带能做的: 把响度拉到跟正经发行的歌一个档次、让整体的明亮度和厚度更接近你听惯的质感、抹掉一点点”业余感”。

母带做不了的:

  • 人声被伴奏埋住——那是混音的事,母带只会把埋住的状态一起放大
  • 唱词吐字不清——母带对此完全无能为力
  • 编曲单薄——响度拉起来只会让单薄更明显
  • 旋律不好听——不解释了

一句总结:母带是给一首已经站得住的歌做的最后一层抛光,不是修补。

4.3 工具(截至 2026-07-23)

LANDRhttps://www.landr.com/pricing/ ):

  • 在线 AI 母带的老牌选手,产品线还包括发行、采样、插件、分轨、AI 作曲、母带 API
  • 有一个 “Fair Trade AI Program” 页面
  • 具体价格档位本次未查证(页面价格为动态渲染,未抓到数字),请以官网当前条款为准

iZotope Ozone 12

  • 2025-09 发布,新增 3 个模块、升级了 AI Master Assistant、Maximizer 新增 IRC 限幅算法
  • 定位:装在你自己的 DAW 里的插件,比在线服务可控,但要学
  • 价格:媒体报道为 Elements $55 / Standard $219 / Advanced $499——来源为搜索摘要与媒体评测,官网抓取被限流,本篇标为待核,请以官网为准

4.4 一条几乎不花钱的路

如果你只是想让歌不那么小声,其实不一定要买母带工具

  • 大多数 DAW 自带一个叫 Limiter(限幅器) 的东西——作用是”给整首歌设一个天花板,不许超过”
  • 挂在整首歌的输出上,把天花板设在略低于最大值的位置,然后慢慢往上推输入
  • 推到你觉得”够响了”就停,不要推到听起来被压扁

这个做法拿不到商业母带的水准,但能解决”我的歌比别人小一半”这个最刺眼的问题。

4.5 这一节可以跳过的情况

  • 你的歌只给自己听
  • 只是配自己的短视频(视频平台大多会自己处理响度)

这两种情况下,跳过母带,直接导出,差别小到你不会在意。


五、导出规格对照

5.1 三种用途,三套做法

用途一:上传到流媒体平台。 格式优先选无损(WAV),工具只给 MP3 就选最高码率;必须做母带

  • 为什么要无损:平台会自己再转码一次。你给的是已经压过的 MP3,它再压一次,损失是叠加的。

用途二:给短视频配乐。 MP3 就够,文件小、上传快;响度不用纠结,短视频平台自己会调。

  • 这种用途更该在意的是长度和卡点,不是音质。

用途三:自己听 / 发给朋友听。 MP3 最高码率,母带可跳过。

  • 记得留一份没压过的原始文件,将来想重做还有素材。

5.2 响度这件事的诚实说法

主流流媒体平台都会把所有歌统一到自己的响度标准上:你的歌如果太响,平台会把它压下来;太轻,有的平台会拉上去,有的不管。

所以”我把歌做得越响越好”是错的——做过头只会被平台压回去,还顺带把动态压没了。

**具体的响度数值,各平台不同、且会调整,本篇不给数字。**请以你要上传的平台当前的创作者文档为准。

不用数字也能判断的土办法:

  1. 找一首和你风格接近的、正经发行的歌
  2. 在同一个播放器里,把你的歌和它接连播放,不要动音量
  3. 如果你的歌明显小 → 还需要提响度
  4. 如果明显更响、而且听着累 → 提过头了,往回退

这个办法不精确,但对本篇的读者来说完全够用。

5.3 导出前必须做的一件事

加 AI 标识。

《人工智能生成合成内容标识办法》2025-09-01 已经施行,对音频有明确要求:

  • 显式标识:在音频的起始、末尾或中间适当位置加语音提示或音频节奏提示
  • 文件层面:提供下载、复制、导出功能时,文件中必须含有符合要求的显式标识
  • 隐式标识:在文件元数据中加入内容属性、服务提供者信息、内容编号
  • 不得删改:任何组织和个人不得恶意删除、篡改、伪造、隐匿标识

完整的操作步骤在篇六。这里只需要你记住一件事:

标识要在导出之前想好,不是上传时再补。


六、动手:把《末班地铁》做成成品

从 demo 到成品,完整链路挑出最好的那版分轨人声 + 伴奏混音三个旋钮母带对齐响度导出按用途选格式最关键的一步挑错了后面全白费这三步加起来,熟练之后一首歌半小时可以跳过的情况:只是自己听、或者配自己的短视频,挑对版本 + 导出就够了必须做的情况:要上传到流媒体平台,响度不对齐会被平台自动压,听感变差别忘了这一步:导出之前,按第六篇的要求把 AI 标识加进去音频提示音、文件显式标识、元数据隐式标识——三样都要,且不能事后删改很多人做完母带直接上传,结果卡在平台审核上

用贯穿全系列的那首中文都市民谣走一遍完整链路。

先说清楚:**这首歌的歌词是人写的,AI 负责的是编曲和演唱。**本系列从不暗示”AI 全自动产出一首好歌”。

6.0 链路总览

图里那条链路是五步:

挑出最好的那版 → 分轨 → 混音(三个旋钮)→ 母带 → 导出

图里还标了两句话,都要记住:

  • “挑出最好的那版”是最关键的一步,挑错了后面全白费
  • 中间三步加起来,熟练之后一首歌半小时

图里也写明了可以跳过的情况: 只是自己听、或者配自己的短视频,挑对版本 + 导出就够了。必须做的情况:要上传到流媒体平台,响度不对齐会被平台自动压,听感变差。

6.1 第一步:挑版本(最关键,别省这半小时)

回到篇二、篇三生成的那一批《末班地铁》。不要拿最后生成的那一版,拿最好的那一版。

挑版本的四个标准,按重要性排序:

  1. 副歌那四句唱得对不对。“今天也没什么不好 / 只是有点想早点睡觉”——这两句要能听清、断句自然。副歌不行,整首废。
  2. **有没有明显的唱崩。**吐字含糊、字唱错、冒出奇怪音节。这些后期修不了。
  3. **主歌到副歌的过渡顺不顺。**有没有突然换个人唱的感觉。
  4. 整体氛围对不对。“深夜感”在不在,木吉他和电钢的比例舒不舒服。

具体动作:

  • 把候选版本连着听三遍,只听副歌
  • 淘汰掉所有有明显唱崩的
  • 剩下的完整听一遍,选一个
  • 下载下来,存成一个单独的文件夹,文件名带上日期

这一步花的时间,是整条链路里回报最高的。

6.2 第二步:分轨

按第一节选的方案来。这里以最常见的两种情况举例:

如果你有 Suno Pro:

  • 直接用 Auto Split(一次输出 12 类)或 Split from Mix(抽出人声,给你”人声 + 其余”两轨)
  • 对《末班地铁》来说,Split from Mix 抽人声就够了——这首歌的后期主要是处理人声和伴奏的关系,不需要把鼓刷单独拆出来

如果你用 LALAL.ai 免费档:

  • 只勾人声这一种类型
  • 这首歌假设 3 分 10 秒,那么消耗 ≈ 3.2 × 2 = 6.4 分钟额度(人声 + 伴奏算两种)
  • 免费的 10 分钟额度,这一首就用掉三分之二
  • 所以:先确认版本挑对了再拆,不要拿三个候选版本各拆一次

如果你用 Demucs:

  • 一条命令下去,输出文件夹里会有拆好的几条 wav
  • 拆几次都不要钱,可以放心把三个候选版本都拆了对比

拆完的验收: 单独听人声轨,词清楚、背景有轻微伴奏残留正常;单独听伴奏轨,没有明显人声。

6.3 第三步:混音三个旋钮

打开你的 DAW,把人声轨和伴奏轨拖进去,确认两条轨都从 0 秒开始(这是对齐的关键,见第七节)。

然后严格按顺序:

旋钮一 · 音量平衡

  • 伴奏定住,人声一点点往上推
  • 这首歌是民谣,人声是主角,人声要比伴奏明显靠前
  • 拿手机外放听副歌那四句,能听清词就停

旋钮二 · 去浑浊

  • 伴奏轨上挂 EQ
  • 200–400 赫兹轻轻减 2–3 个单位
  • 这首歌的浑浊主要来自木吉他的箱体共鸣,减完之后人声会自己浮起来
  • 开关对比,觉得”变空”就退回一半

旋钮三 · 控动态

  • 人声轨上挂压缩器
  • 比例 3:1,阈值慢慢往下调,直到副歌时它有一点点动作
  • 这首歌的人声是”微微沙哑的气声”,压太狠会把气声压没,宁轻勿重
  • 压完用输出增益把音量补回来

做完听三遍。挑不出毛病就收工,不要继续调。

6.4 第四步:母带(要上平台才做)

  • 把整首歌导出成一条完整音频
  • 挂 Limiter,或者送去在线 AI 母带服务
  • 用 5.2 的土办法和一首正经发行的都市民谣做 A/B 对比
  • 不要追求比参考曲更响,做到接近就停

6.5 第五步:加标识,然后导出

顺序是:加标识 → 导出。不是导出 → 再想办法补。

图里那段黄底提示写得很直白:

音频提示音、文件显式标识、元数据隐式标识——三样都要,且不能事后删改。很多人做完母带直接上传,结果卡在平台审核上。

具体每一样怎么加,见篇六

导出格式按第五节的三种用途选:

  • 上平台 → WAV
  • 配短视频 → MP3
  • 自己听 → MP3,另存一份原始文件

6.6 一次完整流程的时间账

第一次做,诚实的预估:挑版本 30 分钟、分轨 10 分钟、混音 40 分钟(第一次要找菜单)、母带 10 分钟、加标识和导出 10 分钟。

合计约 1 小时 40 分钟。 第二首开始会快很多,稳定之后就是图里说的半小时。


七、翻车速查

7.1 分轨出来有”水声”

症状: 人声轨听着像在水下唱,有咕噜声、金属味的伴音。

原因: 分轨模型在人声和伴奏重叠得特别厉害的地方”猜错了”,留下了处理痕迹。这在 AI 生成的歌里更常见,因为它的混音本来就挤。

修法,按顺序试:

  1. 换一个分轨方案。 同一首歌用 Suno 自带和用 Demucs,结果可能差很多。
  2. 换成只拆两类。 拆的类型越多,每一类的痕迹越明显。只要”人声 + 其余”通常最干净。
  3. 接受它。 把人声和伴奏合回去之后,水声通常会被伴奏盖掉大半。单独听人声轨有水声,不代表成品有问题。
  4. 换一版素材。 如果这一版本来就混得特别糊,回去挑别的版本。

不要做的: 疯狂加 EQ 去修水声。修不掉,只会把人声修坏。

7.2 人声和伴奏对不齐

症状: 合起来听有回声感、有轻微的双重人声、节奏发飘。

原因: 两条轨的起始位置差了一点点。绝大多数情况是导入 DAW 时有一条被拖歪了几毫秒。

修法: 先检查两条轨是不是都严格从 0 秒开始(这一条能解决九成的情况);把两条轨都拖到最左端对齐,不要凭眼睛估;还不对就重新分轨一次——分轨工具本身不会改变时长,对不齐几乎一定是操作问题。

预防: 分轨得到的所有文件一起导入、一次性对齐,不要今天拖一条明天拖一条。

7.3 导出后声音变小了

症状: 在 DAW 里听着好好的,导出的文件放到播放器里明显变小。

三种可能,逐个排查:

  1. 导出时选了”归一化”之类的选项,把整体拉回了更低的标准值。找到导出设置里的相关勾选项,关掉重试。
  2. 母带没做,或者做完忘了把增益补回来。 压缩和限幅本身都会让整体变小。
  3. 对比对象变了。 DAW 里是单独听,播放器里是跟别的歌比——这不是变小,是本来就不够响,回第四节做母带。

7.4 手机上听着不对

症状: 电脑耳机上听很好,手机外放一放,人声不见了 / 低音全没了 / 变得很尖。

原因: 手机喇叭几乎发不出低音,而且是单声道。你在耳机里精心调的那些平衡,到手机上会全变形。

修法:

  1. 把手机外放当成主要验收环境,不是备选。整个混音过程中至少用它听三次。
  2. 如果手机上人声不见了 → 回到旋钮一,人声还要再推一点。
  3. 如果手机上很尖 → 说明你在耳机上把高频加多了。小白阶段的建议还是那句:只减,不加。
  4. 如果手机上低音全没了 → 这是正常的,不用为了手机去加低音,那会让耳机上听起来一团糟。

7.5 混音越调越糟,不知道该退到哪一步

症状: 调了两小时,现在还不如刚拆完的时候好听。

原因: 顺序反了,或者每个旋钮都动过了头。

修法: 把所有 EQ、压缩器全部旁通(bypass),退回只有音量推子的状态,然后按顺序重来一遍:音量平衡 → 去浑浊 → 控动态。每一步做完存一个版本,下次不用从头再来。

心法: 这一步的目标是”不难听”,不是”专业”。听三遍挑不出毛病就该收工了——继续调下去,多半是往回调。

7.6 LALAL.ai 额度突然不够了

症状: 以为够用三首歌,第二首就提示额度不足。

原因: 你按”几首歌”估的额度,而它按时长 × 类型数算。见 1.5 那个算例。

修法: 按”总时长 × 每次要拆的类型数”重新算一遍;减少类型数(绝大多数后期只需要”人声 + 伴奏”两类);或者改用 Demucs——本地跑、没有额度概念、MIT 许可可商用。

7.7 速查表

症状最可能的原因先试哪一步
人声轨有水声、咕噜声分轨模型的处理痕迹只拆两类;或换一个分轨方案
合起来有回声、双重人声两条轨起点没对齐检查是否都从 0 秒开始
导出后明显变小导出选项 / 母带增益没补关掉归一化类选项,重导
手机上人声不见了混音时只用耳机验收回旋钮一,人声再推一点
手机上声音很尖高频加过了撤掉所有”加”的操作
整首歌闷、糊200–400 赫兹堆积旋钮二,伴奏轨轻减
主歌太轻副歌太吵动态没控旋钮三,人声 3:1 压缩
越调越糟顺序反了或调过头全部旁通,按顺序重来
额度不够用按”几首歌”估的预算按时长 × 类型数重算
词唱错、吐字含糊生成层面的问题后期修不了,回去重抽

最后一行是这一节最重要的一行。


八、下一步

8.1 这一篇给了你什么

一套判断”这首歌差在哪”的听感语言(不需要乐理)、三条分轨路线和一个不多花钱的算例、一条不踩法律红线的人声路线、三个旋钮和一个不能反的顺序、一条从挑版本到导出的完整链路。

8.2 如果你还想继续

想知道除了 Suno 还有什么、以及怎么不花钱篇五:不只有 Suno

那一篇讲:按用途选工具的决策树、纯 BGM 工具的授权差异(有一家的免费档版权不归你)、开源本地部署的真实硬件门槛、本地和云端的成本对照。

想把这首歌合法地发出去篇六:发布与变现

那一篇讲:AI 标识具体怎么加(本篇第 5.3 和 6.5 欠你的那部分)、Spotify / Apple Music / YouTube 的披露要求、怎么不被当成 spam、发行商怎么选、以及三条变现路径的诚实评估。

如果你觉得这首歌本身还不够好 → 回到篇三继续调提示词。

再说一次本篇开头那句话:**后期能把 demo 抬高一档,但救不了一首生成得就不对的歌。**素材不行的时候,回去重抽比在 DAW 里坐一下午划算得多。

8.3 保质期提醒

本篇涉及价格、档位、功能的内容(第 1.3、1.4、1.7、4.3 节)全部截至 2026-07-23

这个领域的价格和额度大约半年一变,Suno 的功能和条款变得更快。你读到这篇时如果距离上面这个日期已经超过一个季度,请把这几节当成”结构参考”,具体数字一律以各家官网当前页面为准

不会过期的部分只有三样:

  • 三个旋钮的顺序
  • “母带救不了生成得就不对的歌”
  • 不要克隆真人歌手的声音