这篇假设你已经能用 Suno 生成出一首自己还算满意的歌(篇二、篇三讲的事),现在想让它”听起来不像 AI 随手出的”。 你不需要懂乐理,不需要会看波形,也不需要买任何软件。全篇需要的只是耐心。
全文约 40 分钟。动手部分第一次做大约 1.5 小时,熟练之后一首歌半小时。 第四节(AI 母带)和第五节(导出规格)如果你只是自己听或者配自己的短视频,可以先跳过。
这是 AI 音乐系列六篇的第四篇:
- AI 写歌到底是怎么回事:动手之前必须先搞懂的原理和三条红线
- Suno 保姆级教程:从注册到你的第一首完整歌曲
- 让 AI 听懂你要的那个味道:音乐提示词进阶
- 本篇——把 demo 变成成品
- 不只有 Suno:AI 音乐工具全景与本地部署
- AI 音乐怎么合法地发出去:标识、平台政策与上架流程
先说两个词,后面反复出现:
- demo(小样)——能听出这首歌长什么样,但还没打磨过的版本。AI 直出的就是 demo。
- 后期——歌已经录完之后做的那些事:拆轨、调音量、修音色、统一响度。本篇讲的全部是后期。
零、AI 出的歌为什么听着”糊”
0.1 先做一个 30 秒的实验
拿你最满意的那首 AI 歌,和你手机歌单里任意一首正经发行的歌,用同一个音量、连着切换播放。
绝大多数人会立刻听出三件事:
- AI 那首声音小一截,得手动往上推音量才够
- AI 那首的人声像陷在伴奏里,词听得没那么清
- AI 那首从左耳到右耳的宽度更窄,像所有声音都从中间一个点发出来
这三件事跟”旋律好不好听""AI 唱得像不像人”都没关系。它们是制作层面的差距,也正是后期能修的部分。
0.2 四个听感差别,一个个说
图里那四组对照,翻译成你能听出来的话:
一、响度偏小。 切到你这首歌,得把音量往上推两格。
- 响度——一整首歌听起来”有多大声”的整体感觉,不是某一瞬间的峰值。AI 生成时不会替你考虑”这首歌要和几千万首已发行的歌放在一起”。
二、中频挤成一团。 人声和吉他黏在一起,你能听见有人在唱,但听不清在唱什么词。
- 这里的”中频”你可以不管定义,只记听感:闷、糊、像隔了一层布。成因是人声和木吉他天然占同一段音高区间,谁也不让谁。
三、声场窄。 戴上耳机,所有乐器都挤在脑袋正中间。
- 声场——闭上眼睛时,你感觉到的这支乐队摆得有多宽。
四、动态忽大忽小。 主歌太轻要凑近听,副歌一上来又突然吵。
- 动态——一首歌里最轻的地方和最响的地方差多少。差太多就是”忽大忽小”。
0.3 后期能修多少,不能修多少
这是本篇最重要的一句话,图里也写了:
后期能把 demo 抬高一档,但救不了一首生成得就不对的歌。
具体点说:
后期修得了:
- 响度不够、和别的歌切换要调音量
- 人声被伴奏盖住、词听不清
- 整首歌闷、糊
- 主歌太轻副歌太吵
- 结尾收得突兀(可以自己剪一个淡出)
后期修不了:
- 旋律不好听
- 唱词吐字含糊、把字唱错、唱出奇怪的音节
- 编曲本身就单薄(只有两件乐器在那儿撑三分钟)
- 副歌不炸——这是写出来的,不是调出来的
- 风格跑偏(你要民谣它给你摇滚)
所以正确的顺序是:**先回篇二、篇三多抽几次卡,挑到一版你听三遍都不腻的,再开始做后期。**在一版本来就不行的素材上花两小时,是这件事上最常见的浪费。
0.4 这一节的结论
后期不是”让歌变好听”,是”让一首本来就还行的歌,不在别人的播放器里吃亏”。
期望值放在这里,后面每一步你都不会失望。
一、分轨:把一首歌拆成人声和伴奏
1.1 什么是分轨,为什么必须先做
分轨(stem separation)——把一首已经混好的歌,重新拆回成”人声一条、伴奏一条”这样的独立音轨。英文里每一条叫一个 stem。
为什么必须先做:没拆开之前,你什么都调不了。
- 想把人声调大一点?没拆开,你只能把整首歌一起调大,人声和伴奏的比例纹丝不动。
- 想把伴奏的浑浊感去掉?没拆开,你一动就把人声也一起削了。
拆开之后你才有两个(或更多)独立的东西可以分别处理。这就是后期的起点。
副产品也很有用:只要伴奏可以给视频配 BGM、做卡拉 OK 版;只要人声可以换一个伴奏、或者做一段清唱。
1.2 三条路怎么选(截至 2026-07-23)
图里给了三条路,各自的适用人群非常清楚:
- 你已经订了 Suno 的付费档、歌也是 Suno 生成的 → 用 Suno 自带的,别折腾。
- 你要处理的音频不在 Suno 里(比如别处生成的、或者自己录的)、又不想装软件 → LALAL.ai。
- 你要长期做、量大、或者在乎成本和商用授权 → Demucs,本地跑,免费。
下面逐条说,价格与功能一律以调研当日抓取为准,具体条款请以官网当前页面为准。
1.3 方案一:Suno 自带(截至 2026-07-23)
能力边界:
- Free 档没有分轨功能,而且免费档明确禁止商用。要做后期,至少得是 Pro。
- Pro 档 2 种分轨:Auto Split、Split from Mix。
- Premier 档 3 种:多一个 Advanced Split。
三种模式各是什么(官方 release notes,2026-06-11 更新):
- Auto Split——经典款,一次输出 12 类 stem。对小白来说这是默认选项。
- Split from Mix——你指定抽出某一件乐器或人声,它给你两条轨:“它” + “其余全部”。想单独动人声时最省事。
- Advanced Split——从近 100 种乐器里挑要拆什么。仅 Premier 档可用。
优点: 不用离开 Suno,不用上传下载,跟着订阅走,不额外花钱。
限制(图里标黄的那条): **只能处理 Suno 里的歌。**你在别处生成的、或者自己手机录的东西,进不来这条路。
1.4 方案二:LALAL.ai —— 计费方式最容易算错(截至 2026-07-23)
这是本节最需要你花两分钟看懂的地方。
它的档位(官网 pricing 页,2026-07-23 抓取):
- Starter:永久免费,总共 10 分钟额度(一次性,不是每月)
- Lite:约 $7.5/月
- Pro:约 $15/月
年付折算价在页面上的表述本次抓取到的口径不一致,具体请以官网当前价格页为准。
付费档的队列机制(这点很多人搞反):
- 付费档 = Relaxed Queue 分钟数无限 + Fast Queue 固定额度
- Fast Queue 额度:Lite 90 分钟/月,Pro 250 分钟/月
- 两个队列分离质量完全一样,只差排队速度
- 不能手动切换:每月先自动走 Fast,用完自动转 Relaxed
- VST 插件、桌面端本地处理、API 仅 Pro 档
1.5 那个必须算的算例
计费公式:分钟数 = 文件时长 × 你要分离出的 stem 类型数。
注意是乘,不是加,也不是”一首歌算一次”。
算例一:一首 3 分钟的歌,只要人声和伴奏两种
3 分钟 × 2 种 = 6 分钟额度
算例二:同一首 3 分钟的歌,想拆成人声、鼓、贝斯、其他四种
3 分钟 × 4 种 = 12 分钟额度
同一首歌,什么都没变,只因为多勾了两个类型,额度消耗翻了一倍。
这个坑长什么样:
- 免费档 10 分钟。你以为”够拆三首歌”。
- 实际:第一首 3 分钟的歌拆 2 种,用掉 6 分钟,剩 4 分钟。
- 第二首同样长度同样拆法需要 6 分钟,不够了。
- 免费额度实际只够一首歌,加上一小段试验。
买 Lite 档的人也会犯同样的错:
- Fast Queue 90 分钟/月,很多人心算”90 ÷ 3 = 每月 30 首”。
- 每首拆 2 种,实际 90 ÷ 6 = 15 首。
- 每首拆 4 种,实际 90 ÷ 12 = 7 首多一点。
按”几首歌”估额度的人,普遍会买少一半以上。 正确做法是先按”总时长 × 平均类型数”算一遍再决定档位。
一个缓解办法: 付费档的 Relaxed Queue 分钟数无限、质量完全一样。所以对付费用户来说,Fast 额度用完不等于不能干活,只是要排队等。真正被这个公式卡死的,是免费档用户。
1.6 方案三:Demucs —— 免费、可商用、要用命令行
Demucs(开源,Meta 系,仓库 https://github.com/adefossez/demucs ):
- MIT 许可,代码与项目均为 MIT
- 本地跑、免费、可商用
- 它是所有在线分轨服务的事实基线——很多商业服务底下跑的就是这一类模型
为什么值得推荐给认真做的人:
- 没有分钟额度,没有类型数乘法,拆多少次都不要钱
- 音频不上传到别人服务器
- MIT 许可意味着商用没有授权障碍——这在整篇里是难得的、不会过期的确定性
代价(图里标黄的那条): 命令行,第一次配置要花时间。
最简路径(以仓库 README 当前说明为准,下面只是形状):
- 装 Python(3.9 以上),装的时候勾上”加入 PATH”
- 打开终端 / 命令提示符
- 装它:
pip install -U demucs - 拆一首歌:
demucs 你的歌.mp3 - 等它跑完,在自动生成的输出文件夹里找到分好的几条 wav
第一次跑的三个心理准备: 首次运行会下载模型文件(几百 MB 起,要等);纯 CPU 也能跑,就是慢(一首 3 分钟的歌可能要十几分钟);报错基本都出在 Python 环境上而不是 Demucs 本身,把报错整段贴给 AI 问通常五分钟内能解决。
1.7 还有一个:Moises
Moises(https://moises.ai/ )官网确认有免费档(每月有限次上传 + 部分功能),完整价目表需登录后才可见——具体档位与价格本次未查证,请以官网当前条款为准。
定位上它介于 LALAL.ai 和 Suno 之间:网页/App 操作,功能比纯分轨多。如果你想再多试一家,可以看它。
1.8 分轨这一步的验收标准
拆完之后,分别单独听一遍:
- 人声轨:听得清词,背景里有一点点伴奏残留是正常的
- 伴奏轨:听不到明显的人声,偶尔飘过一点气声可以忍
如果人声轨里有明显的”水声""咕噜声""像在水下唱歌”,翻到第七节看修法。
二、人声这条线(含法律红线)
这一节先讲红线,再讲能做什么。顺序不能反。
2.1 红线:不要克隆真人歌手的声音
这不是建议,是明确的红线。
海外平台已经明文禁止。 Spotify 在 2025-09-25 的政策发布中直接写:未经授权使用 AI 克隆艺人声音,是对其身份的剥削,破坏其艺术性,威胁作品的根本完整性。Spotify 的冒名(impersonation)政策当日立即生效。同一份政策里 Spotify 也说明:部分艺人可以选择授权自己的声音给 AI 项目,“选择权必须留在艺人手里”。
国内同样有法律风险。 中国法下,自然人的声音受人格权保护(《民法典》人格权编规定声音参照适用肖像权保护的规定)。
具体条文编号本篇不引用——调研时未核对原文条号,你如果要在正式文书里引用,请自行核实条号后再用。
“AI 翻唱”是重灾区。 拿别人的歌 + 明星的音色做 AI 翻唱,同时踩三条线:
- 录音版权
- 词曲著作权
- 声音 / 人格权
而且——标注”AI 生成”不能免除这三项责任。这是国内合规解读普遍强调的一点(二手来源)。
后果不是”被举报了删掉就行”:
- 平台侧:下架、账号处罚,Spotify 的冒名政策是立即生效的那种
- 民事侧:被克隆者可以主张人格权侵权
- 如果你还拿它变现了,性质会更重
本篇不提供任何绕过手段,也不提供克隆他人声音的操作步骤。 开源工具确实存在(比如 RVC 这类音色转换项目),但开源”免费”不等于”合法”,它不提供任何法律保护,出事全部由使用者承担。这一点必须说清楚。
2.2 合规路径一:用工具自带的授权音色
这是最省事、最安全的一条。
它是什么: 工具方自己准备好、并且已经拿到授权的虚拟歌手音色。你只管选一个、给词、让它唱。
为什么安全: 声音的授权链条在工具方那边,不在你身上。
典型场景:
- Suno 直接生成时,用 Style 框里的人声描述(比如贯穿案例里的”男声, 微微沙哑的气声”)——这本身就是在选授权音色,只是它不给你列表挑
- 专业歌声合成软件里,选一个内置歌手
代价: 音色不是你说了算,你只能在它给的范围里挑,而且描述词是概率性的——同一句描述,两次生成可能给你两种嗓子。
2.3 合规路径二:克隆你自己的声音
这条路的核心前提只有一句:被克隆的人是你本人,你能对这份授权负责。
Suno 的 Voices 功能(官方 release notes,2026-03-26 随 v5.5 上线):
- 你录制或上传自己的声音,之后让 Suno 用你的嗓音演唱
- 同批还上线了 Custom Models:上传自己作品集里至少 6 首曲子,训练一个属于你的 v5.5 变体
做这件事之前的三个提醒:
- 只用你自己的声音。 用室友的、用某个视频里的、用你喜欢的歌手的——全部越线。
- 看清工具的条款。 你上传的声音样本被怎么使用、能不能删除,各家写法不同,以官网当前条款为准。
- 录制质量决定上限。 安静的房间、离麦克风一拳距离、不要贴着手机吼。这一步糊了,后面全糊。
一个诚实提醒: 大多数人第一次听到”用自己声音唱的 AI 歌”会觉得别扭,因为你熟悉的是自己颅骨里听到的声音,不是别人听到的那个。这不是工具的问题,多听几遍就适应了。
2.4 专业歌声合成软件:只讲定位
如果你想更精细地控制每一个字怎么唱,有一类专门的软件,叫歌声合成——你输入歌词和旋律,它用虚拟歌手唱出来。
两个常被提到的:
- Synthesizer V Studio 2 Pro(Dreamtonics):定位更像”可精细控制的 AI 歌手插件”
- ACE Studio 2:定位更像”一体化 AI 人声制作环境”,价格高一个数量级
两者的具体价格,调研时只拿到二手来源(搜索摘要与论坛),未核到官方商店页,本篇不写数字。请以各自官网为准。 上面的定位差异同样来自二手来源。
适合: 你已经会写旋律或能自己哼出来,且要的是”这一个字的尾音怎么收”这种级别的控制。
不适合: 只想让一首 AI 歌听起来更好——那不是它解决的问题,这一段你可以跳过。
三、混音:只做三件事就够
3.1 先把期待放对位置
混音——把已经拆开的几条轨,重新调成一个好听的整体。
打开任何一个音频软件,你会看到上百个参数。现阶段你只需要动三个,图里那三个。剩下的全都可以不碰。
图里最下面那句话就是这一节的验收标准:
这一步的目标不是”专业”,是”不难听”。听三遍还挑不出毛病就可以收工了。
3.2 顺序不能反
图里标黄的那条最重要:
先平衡音量,再去浑浊,最后压缩。顺序反了会反复推倒重来。
为什么:
- 你先去浑浊,再调音量——音量一变,刚才削掉的量又不对了,得重削
- 你先压缩,再调音量——压缩的效果跟输入音量直接相关,音量一变,压缩全白调
顺序反了不会出错,只会让你把同一件事做三遍。
3.3 旋钮一:音量平衡
做什么:把人声调得比伴奏再大一点点。
- 找到每条轨的音量推子(每个软件都有,长得像一根可以上下拖的滑杆)
- 先把伴奏定在一个舒服的位置,再一点点往上推人声
- “一点点”是真的一点点,推过头会显得人声浮在外面,跟伴奏脱节
判断标准(图里给的):手机外放能听清词。
这个标准比戴耳机严格得多,而且更接近真实收听场景——大部分人听你的歌就是拿手机外放。手机外放能听清,戴耳机一定没问题。
这一步做完的感觉: 你会发现”AI 歌听不清词”这个毛病,有一多半在这里就解决了。
3.4 旋钮二:去浑浊
做什么:把 200 到 400 赫兹轻轻减一点。
先解释这句话里唯一的术语:
- 赫兹(Hz)——描述声音高低的单位。数字越小,声音越低沉;数字越大,声音越尖细。
- 200 到 400 赫兹大致是”男声胸腔共鸣、木吉他箱体嗡嗡声”待的那一片。这一片东西堆多了,整首歌就闷。
- EQ(均衡器)——一个可以”把某一片高低区间调大或调小”的工具。每个音频软件都有,通常就叫 EQ 或均衡。
怎么做:
- 在伴奏轨上找到 EQ / 均衡器
- 把频率设在 200–400 之间
- 轻轻往下减——减 2 到 3 个单位就够,不要减一半
- 来回开关这个 EQ,对比听
判断标准(图里给的):不再有”闷罐子感”。
“闷罐子感”就是那种整首歌像装在纸箱里放出来的感觉。减掉之后,人声会自己往前浮一层。
三个提醒: 只减不加(小白阶段加什么都是灾难);优先减伴奏不减人声(人声减多了会变薄变尖);减完觉得”变空了”就是减多了,往回退一半。
3.5 旋钮三:控动态
做什么:给人声加压缩,比例三比一起步。
- 压缩器(Compressor)——一个”自动帮你压住太响的地方”的工具。你唱轻的时候它不管,唱重超过某个线之后它把超出的部分按比例压下去。
- 三比一是压缩比例:超出的部分只让它长三分之一。这是最常用的温和设定。
怎么做:
- 在人声轨上找到压缩器
- 比例(Ratio)设成 3:1
- 慢慢往下调阈值(Threshold,就是”从多响开始压”那根线),直到你看到它在副歌时有一点点动作
- 压完整体会变小一点,用输出增益补回来
判断标准(图里给的):轻声和重声一样清楚。
也就是主歌你不用凑近听,副歌不用躲。
最容易犯的错: 压太狠。压过头的表现是整首歌像被按住了,没有起伏,副歌上来一点都不激动。宁可压得不够,也不要压过头。
3.6 用什么软件(图里给的免费选项)
图里给出的三个免费够用的选择:
- Reaper(试用期无限)
- Audacity
- GarageBand(macOS 自带)
这三个是配图给出的选项。它们各自的授权条款、试用规则请以各家官网为准。
这类软件统称 DAW——数字音频工作站,就是”把多条音轨摆在一起编辑”的软件。
怎么挑: 用 Mac 又想快点做完选 GarageBand(开机就有);想要一个能长期用下去的选 Reaper;只想剪一剪、加个淡出,Audacity 就够。
本篇不给具体菜单路径。 各家 DAW 的菜单结构、版本差异都很大,写死了反而误导。你需要在界面上找的东西只有三个:音量推子、EQ、压缩器。这三个词在任何一个 DAW 里都存在,找不到就搜这三个词。
3.7 三个旋钮之外,唯一值得多做的一件事
给结尾加一个淡出。
AI 生成的歌经常收尾很突兀——上一秒还在唱,下一秒就没了。
做法:在最后两三秒把整体音量拉一条斜线到零。任何 DAW 都支持,通常叫 fade out 或淡出。
这一下的性价比,比你调半小时 EQ 都高。
四、AI 母带:能做多少,做不了多少
4.1 母带是什么
母带(Mastering)——把整首歌的音量和音色做最后一次统一,让它和别的歌放在一起时不吃亏。
注意和混音的区别:
- 混音处理的是多条轨之间的关系(人声和伴奏谁大谁小)
- 母带处理的是已经合成一条的整首歌(这一首和别人那一首比,够不够响、够不够亮)
母带是后期的最后一步。混音没做好,母带只会把问题一起放大。
4.2 诚实说明:母带救不了一首生成得就不对的歌
这句话必须放在工具介绍前面。
母带能做的: 把响度拉到跟正经发行的歌一个档次、让整体的明亮度和厚度更接近你听惯的质感、抹掉一点点”业余感”。
母带做不了的:
- 人声被伴奏埋住——那是混音的事,母带只会把埋住的状态一起放大
- 唱词吐字不清——母带对此完全无能为力
- 编曲单薄——响度拉起来只会让单薄更明显
- 旋律不好听——不解释了
一句总结:母带是给一首已经站得住的歌做的最后一层抛光,不是修补。
4.3 工具(截至 2026-07-23)
LANDR(https://www.landr.com/pricing/ ):
- 在线 AI 母带的老牌选手,产品线还包括发行、采样、插件、分轨、AI 作曲、母带 API
- 有一个 “Fair Trade AI Program” 页面
- 具体价格档位本次未查证(页面价格为动态渲染,未抓到数字),请以官网当前条款为准
iZotope Ozone 12:
- 2025-09 发布,新增 3 个模块、升级了 AI Master Assistant、Maximizer 新增 IRC 限幅算法
- 定位:装在你自己的 DAW 里的插件,比在线服务可控,但要学
- 价格:媒体报道为 Elements $55 / Standard $219 / Advanced $499——来源为搜索摘要与媒体评测,官网抓取被限流,本篇标为待核,请以官网为准
4.4 一条几乎不花钱的路
如果你只是想让歌不那么小声,其实不一定要买母带工具:
- 大多数 DAW 自带一个叫 Limiter(限幅器) 的东西——作用是”给整首歌设一个天花板,不许超过”
- 挂在整首歌的输出上,把天花板设在略低于最大值的位置,然后慢慢往上推输入
- 推到你觉得”够响了”就停,不要推到听起来被压扁
这个做法拿不到商业母带的水准,但能解决”我的歌比别人小一半”这个最刺眼的问题。
4.5 这一节可以跳过的情况
- 你的歌只给自己听
- 只是配自己的短视频(视频平台大多会自己处理响度)
这两种情况下,跳过母带,直接导出,差别小到你不会在意。
五、导出规格对照
5.1 三种用途,三套做法
用途一:上传到流媒体平台。 格式优先选无损(WAV),工具只给 MP3 就选最高码率;必须做母带。
- 为什么要无损:平台会自己再转码一次。你给的是已经压过的 MP3,它再压一次,损失是叠加的。
用途二:给短视频配乐。 MP3 就够,文件小、上传快;响度不用纠结,短视频平台自己会调。
- 这种用途更该在意的是长度和卡点,不是音质。
用途三:自己听 / 发给朋友听。 MP3 最高码率,母带可跳过。
- 记得留一份没压过的原始文件,将来想重做还有素材。
5.2 响度这件事的诚实说法
主流流媒体平台都会把所有歌统一到自己的响度标准上:你的歌如果太响,平台会把它压下来;太轻,有的平台会拉上去,有的不管。
所以”我把歌做得越响越好”是错的——做过头只会被平台压回去,还顺带把动态压没了。
**具体的响度数值,各平台不同、且会调整,本篇不给数字。**请以你要上传的平台当前的创作者文档为准。
不用数字也能判断的土办法:
- 找一首和你风格接近的、正经发行的歌
- 在同一个播放器里,把你的歌和它接连播放,不要动音量
- 如果你的歌明显小 → 还需要提响度
- 如果明显更响、而且听着累 → 提过头了,往回退
这个办法不精确,但对本篇的读者来说完全够用。
5.3 导出前必须做的一件事
加 AI 标识。
《人工智能生成合成内容标识办法》2025-09-01 已经施行,对音频有明确要求:
- 显式标识:在音频的起始、末尾或中间适当位置加语音提示或音频节奏提示
- 文件层面:提供下载、复制、导出功能时,文件中必须含有符合要求的显式标识
- 隐式标识:在文件元数据中加入内容属性、服务提供者信息、内容编号
- 不得删改:任何组织和个人不得恶意删除、篡改、伪造、隐匿标识
完整的操作步骤在篇六。这里只需要你记住一件事:
标识要在导出之前想好,不是上传时再补。
六、动手:把《末班地铁》做成成品
用贯穿全系列的那首中文都市民谣走一遍完整链路。
先说清楚:**这首歌的歌词是人写的,AI 负责的是编曲和演唱。**本系列从不暗示”AI 全自动产出一首好歌”。
6.0 链路总览
图里那条链路是五步:
挑出最好的那版 → 分轨 → 混音(三个旋钮)→ 母带 → 导出
图里还标了两句话,都要记住:
- “挑出最好的那版”是最关键的一步,挑错了后面全白费
- 中间三步加起来,熟练之后一首歌半小时
图里也写明了可以跳过的情况: 只是自己听、或者配自己的短视频,挑对版本 + 导出就够了。必须做的情况:要上传到流媒体平台,响度不对齐会被平台自动压,听感变差。
6.1 第一步:挑版本(最关键,别省这半小时)
回到篇二、篇三生成的那一批《末班地铁》。不要拿最后生成的那一版,拿最好的那一版。
挑版本的四个标准,按重要性排序:
- 副歌那四句唱得对不对。“今天也没什么不好 / 只是有点想早点睡觉”——这两句要能听清、断句自然。副歌不行,整首废。
- **有没有明显的唱崩。**吐字含糊、字唱错、冒出奇怪音节。这些后期修不了。
- **主歌到副歌的过渡顺不顺。**有没有突然换个人唱的感觉。
- 整体氛围对不对。“深夜感”在不在,木吉他和电钢的比例舒不舒服。
具体动作:
- 把候选版本连着听三遍,只听副歌
- 淘汰掉所有有明显唱崩的
- 剩下的完整听一遍,选一个
- 下载下来,存成一个单独的文件夹,文件名带上日期
这一步花的时间,是整条链路里回报最高的。
6.2 第二步:分轨
按第一节选的方案来。这里以最常见的两种情况举例:
如果你有 Suno Pro:
- 直接用 Auto Split(一次输出 12 类)或 Split from Mix(抽出人声,给你”人声 + 其余”两轨)
- 对《末班地铁》来说,Split from Mix 抽人声就够了——这首歌的后期主要是处理人声和伴奏的关系,不需要把鼓刷单独拆出来
如果你用 LALAL.ai 免费档:
- 只勾人声这一种类型
- 这首歌假设 3 分 10 秒,那么消耗 ≈ 3.2 × 2 = 6.4 分钟额度(人声 + 伴奏算两种)
- 免费的 10 分钟额度,这一首就用掉三分之二
- 所以:先确认版本挑对了再拆,不要拿三个候选版本各拆一次
如果你用 Demucs:
- 一条命令下去,输出文件夹里会有拆好的几条 wav
- 拆几次都不要钱,可以放心把三个候选版本都拆了对比
拆完的验收: 单独听人声轨,词清楚、背景有轻微伴奏残留正常;单独听伴奏轨,没有明显人声。
6.3 第三步:混音三个旋钮
打开你的 DAW,把人声轨和伴奏轨拖进去,确认两条轨都从 0 秒开始(这是对齐的关键,见第七节)。
然后严格按顺序:
旋钮一 · 音量平衡
- 伴奏定住,人声一点点往上推
- 这首歌是民谣,人声是主角,人声要比伴奏明显靠前
- 拿手机外放听副歌那四句,能听清词就停
旋钮二 · 去浑浊
- 在伴奏轨上挂 EQ
- 200–400 赫兹轻轻减 2–3 个单位
- 这首歌的浑浊主要来自木吉他的箱体共鸣,减完之后人声会自己浮起来
- 开关对比,觉得”变空”就退回一半
旋钮三 · 控动态
- 在人声轨上挂压缩器
- 比例 3:1,阈值慢慢往下调,直到副歌时它有一点点动作
- 这首歌的人声是”微微沙哑的气声”,压太狠会把气声压没,宁轻勿重
- 压完用输出增益把音量补回来
做完听三遍。挑不出毛病就收工,不要继续调。
6.4 第四步:母带(要上平台才做)
- 把整首歌导出成一条完整音频
- 挂 Limiter,或者送去在线 AI 母带服务
- 用 5.2 的土办法和一首正经发行的都市民谣做 A/B 对比
- 不要追求比参考曲更响,做到接近就停
6.5 第五步:加标识,然后导出
顺序是:加标识 → 导出。不是导出 → 再想办法补。
图里那段黄底提示写得很直白:
音频提示音、文件显式标识、元数据隐式标识——三样都要,且不能事后删改。很多人做完母带直接上传,结果卡在平台审核上。
具体每一样怎么加,见篇六。
导出格式按第五节的三种用途选:
- 上平台 → WAV
- 配短视频 → MP3
- 自己听 → MP3,另存一份原始文件
6.6 一次完整流程的时间账
第一次做,诚实的预估:挑版本 30 分钟、分轨 10 分钟、混音 40 分钟(第一次要找菜单)、母带 10 分钟、加标识和导出 10 分钟。
合计约 1 小时 40 分钟。 第二首开始会快很多,稳定之后就是图里说的半小时。
七、翻车速查
7.1 分轨出来有”水声”
症状: 人声轨听着像在水下唱,有咕噜声、金属味的伴音。
原因: 分轨模型在人声和伴奏重叠得特别厉害的地方”猜错了”,留下了处理痕迹。这在 AI 生成的歌里更常见,因为它的混音本来就挤。
修法,按顺序试:
- 换一个分轨方案。 同一首歌用 Suno 自带和用 Demucs,结果可能差很多。
- 换成只拆两类。 拆的类型越多,每一类的痕迹越明显。只要”人声 + 其余”通常最干净。
- 接受它。 把人声和伴奏合回去之后,水声通常会被伴奏盖掉大半。单独听人声轨有水声,不代表成品有问题。
- 换一版素材。 如果这一版本来就混得特别糊,回去挑别的版本。
不要做的: 疯狂加 EQ 去修水声。修不掉,只会把人声修坏。
7.2 人声和伴奏对不齐
症状: 合起来听有回声感、有轻微的双重人声、节奏发飘。
原因: 两条轨的起始位置差了一点点。绝大多数情况是导入 DAW 时有一条被拖歪了几毫秒。
修法: 先检查两条轨是不是都严格从 0 秒开始(这一条能解决九成的情况);把两条轨都拖到最左端对齐,不要凭眼睛估;还不对就重新分轨一次——分轨工具本身不会改变时长,对不齐几乎一定是操作问题。
预防: 分轨得到的所有文件一起导入、一次性对齐,不要今天拖一条明天拖一条。
7.3 导出后声音变小了
症状: 在 DAW 里听着好好的,导出的文件放到播放器里明显变小。
三种可能,逐个排查:
- 导出时选了”归一化”之类的选项,把整体拉回了更低的标准值。找到导出设置里的相关勾选项,关掉重试。
- 母带没做,或者做完忘了把增益补回来。 压缩和限幅本身都会让整体变小。
- 对比对象变了。 DAW 里是单独听,播放器里是跟别的歌比——这不是变小,是本来就不够响,回第四节做母带。
7.4 手机上听着不对
症状: 电脑耳机上听很好,手机外放一放,人声不见了 / 低音全没了 / 变得很尖。
原因: 手机喇叭几乎发不出低音,而且是单声道。你在耳机里精心调的那些平衡,到手机上会全变形。
修法:
- 把手机外放当成主要验收环境,不是备选。整个混音过程中至少用它听三次。
- 如果手机上人声不见了 → 回到旋钮一,人声还要再推一点。
- 如果手机上很尖 → 说明你在耳机上把高频加多了。小白阶段的建议还是那句:只减,不加。
- 如果手机上低音全没了 → 这是正常的,不用为了手机去加低音,那会让耳机上听起来一团糟。
7.5 混音越调越糟,不知道该退到哪一步
症状: 调了两小时,现在还不如刚拆完的时候好听。
原因: 顺序反了,或者每个旋钮都动过了头。
修法: 把所有 EQ、压缩器全部旁通(bypass),退回只有音量推子的状态,然后按顺序重来一遍:音量平衡 → 去浑浊 → 控动态。每一步做完存一个版本,下次不用从头再来。
心法: 这一步的目标是”不难听”,不是”专业”。听三遍挑不出毛病就该收工了——继续调下去,多半是往回调。
7.6 LALAL.ai 额度突然不够了
症状: 以为够用三首歌,第二首就提示额度不足。
原因: 你按”几首歌”估的额度,而它按时长 × 类型数算。见 1.5 那个算例。
修法: 按”总时长 × 每次要拆的类型数”重新算一遍;减少类型数(绝大多数后期只需要”人声 + 伴奏”两类);或者改用 Demucs——本地跑、没有额度概念、MIT 许可可商用。
7.7 速查表
| 症状 | 最可能的原因 | 先试哪一步 |
|---|---|---|
| 人声轨有水声、咕噜声 | 分轨模型的处理痕迹 | 只拆两类;或换一个分轨方案 |
| 合起来有回声、双重人声 | 两条轨起点没对齐 | 检查是否都从 0 秒开始 |
| 导出后明显变小 | 导出选项 / 母带增益没补 | 关掉归一化类选项,重导 |
| 手机上人声不见了 | 混音时只用耳机验收 | 回旋钮一,人声再推一点 |
| 手机上声音很尖 | 高频加过了 | 撤掉所有”加”的操作 |
| 整首歌闷、糊 | 200–400 赫兹堆积 | 旋钮二,伴奏轨轻减 |
| 主歌太轻副歌太吵 | 动态没控 | 旋钮三,人声 3:1 压缩 |
| 越调越糟 | 顺序反了或调过头 | 全部旁通,按顺序重来 |
| 额度不够用 | 按”几首歌”估的预算 | 按时长 × 类型数重算 |
| 词唱错、吐字含糊 | 生成层面的问题 | 后期修不了,回去重抽 |
最后一行是这一节最重要的一行。
八、下一步
8.1 这一篇给了你什么
一套判断”这首歌差在哪”的听感语言(不需要乐理)、三条分轨路线和一个不多花钱的算例、一条不踩法律红线的人声路线、三个旋钮和一个不能反的顺序、一条从挑版本到导出的完整链路。
8.2 如果你还想继续
想知道除了 Suno 还有什么、以及怎么不花钱 → 篇五:不只有 Suno
那一篇讲:按用途选工具的决策树、纯 BGM 工具的授权差异(有一家的免费档版权不归你)、开源本地部署的真实硬件门槛、本地和云端的成本对照。
想把这首歌合法地发出去 → 篇六:发布与变现
那一篇讲:AI 标识具体怎么加(本篇第 5.3 和 6.5 欠你的那部分)、Spotify / Apple Music / YouTube 的披露要求、怎么不被当成 spam、发行商怎么选、以及三条变现路径的诚实评估。
如果你觉得这首歌本身还不够好 → 回到篇三继续调提示词。
再说一次本篇开头那句话:**后期能把 demo 抬高一档,但救不了一首生成得就不对的歌。**素材不行的时候,回去重抽比在 DAW 里坐一下午划算得多。
8.3 保质期提醒
本篇涉及价格、档位、功能的内容(第 1.3、1.4、1.7、4.3 节)全部截至 2026-07-23。
这个领域的价格和额度大约半年一变,Suno 的功能和条款变得更快。你读到这篇时如果距离上面这个日期已经超过一个季度,请把这几节当成”结构参考”,具体数字一律以各家官网当前页面为准。
不会过期的部分只有三样:
- 三个旋钮的顺序
- “母带救不了生成得就不对的歌”
- 不要克隆真人歌手的声音
留言功能暂时不可用,请稍后再试。