L O A D I N G
↓ 向下滚动进入
ORIZURU

让 AI 听懂你要的那个味道:音乐提示词进阶

这篇假设你已经用 Suno 做出过至少一首完整的歌,知道 Custom 模式里那三个框分别是干什么的。 如果还没有,先去看 篇二,那边有可以原样复制的例子。

全文约 40 分钟。第八节是动手环节,跟着做大概 30 分钟。 第二节(逆向参考曲)和第六节(局部返工)第一次读可以先跳过,等你手上真的有一首”差点意思”的歌,再回来看会更有用。

这是 AI 音乐系列六篇的第三篇:

  1. AI 写歌到底是怎么回事:原理和三条红线
  2. Suno 保姆级教程:从注册到第一首完整歌曲
  3. 本篇——让它做成你要的样子
  4. 把 AI demo 变成能听的成品
  5. 不只有 Suno:工具全景与本地部署
  6. AI 音乐怎么合法地发出去

一个必须先说清楚的前提

本篇讲的所有写法——七个零件、结构标签、段落参数——都是社区经验,不是官方规范。调研时的实际情况是:Suno 官方帮助中心里找不到风格描述词和结构标签的规范定义页(相关文档目录返回 404,查证于 2026-07-23),网上流传的那些”meta tag 大全”全是用户互相摸索出来的。

两个后果,你从第一行就得记住:

  • 没有”正确语法”这回事。 我给的写法是”多数情况下有效”,不是”官方规定必须这么写”。
  • 它是概率,不是命令。 你写下一个词,模型大概率会朝那个方向走,但它有权忽略。被忽略时正确做法是重新生成或换个更简单的说法,而不是加更多词逼它就范

零、为什么你的歌”差点意思”

一条好的风格描述,有七个零件缺哪个零件,它就在哪个维度上随机年代90 年代地域日本流派citypop编制电钢 贝斯情绪慵懒 微醺人声女声 气声质感模拟磁带拼起来:90 年代日本 citypop, 电钢与贝斯, 慵懒微醺, 女声气声, 模拟磁带质感写全七个零件它在你划定的范围里随机每次生成都能用差别只在细节只写「好听的 citypop」它在整个流派里随机十次里可能一次能用点数就是这么烧掉的一个反直觉的经验:零件不是越多越好超过十个词之后,它们会互相打架,反而不如七个精准的词。写完先删一遍

0.1 你不是描述得不够多,是描述得不够全

绝大多数人写风格描述的样子是这样的:

好听的 citypop,很有感觉,高级感,treble 清晰,专业制作

这段话里有五个词,但只有一个零件(流派:citypop)。剩下四个词——好听、有感觉、高级感、专业制作——模型接不住。它们不是音乐属性,是你的听后感。

结果就是:它在整个 citypop 这个大类里随机抽。十次里可能有一次撞上你想要的,剩下九次的点数就是这么烧掉的。

0.2 七个零件

一条能稳定复现的风格描述,拆开来看有七个位置:

零件它在管什么
年代制作年代带来的整体审美90 年代
地域语言、演唱习惯、旋律走向日本
流派骨架,决定和弦走向和节奏框架citypop
编制有哪几件乐器,谁在打底电钢 贝斯
情绪演唱和演奏的表情慵懒 微醺
人声性别、唱法、位置女声 气声
质感录音和混音听起来像什么设备做的模拟磁带

拼起来就是:

90 年代日本 citypop, 电钢与贝斯, 慵懒微醺, 女声气声, 模拟磁带质感

这条描述和上面那条一样长,但信息量差了一个数量级。

0.3 缺哪个零件,它就在哪个维度上随机

这是理解整件事的关键:模型不会因为你没写年代就”不管年代”。它必须为每一个维度做出决定——只是你没写的那些,它自己随机决定。

  • 你没写年代 → 可能给你 2020 年代的干净制作,也可能给你 70 年代的糊
  • 你没写编制 → 可能给你一把木吉他,也可能给你一整个交响乐团
  • 你没写人声 → 男女、清亮沙哑,全看运气

所以”每次生成都不一样”不是模型不稳定,是你留了太多空位给它填。

反过来说,留空位也可以是故意的:你想看看它对”深夜的城市”会给出什么编制,那就把编制那格空着,多抽几次当采风。这是策略不是错误——前提是你知道自己在留哪一格。

0.4 反直觉的那条:零件不是越多越好

知道了七个零件,大多数人的下一个动作是往里面塞更多词。这是本篇最想拦住的行为。

经验值:整条 Style 描述超过十个词之后,词与词会开始互相打架,结果反而不如七个精准的词。

打架长什么样:

  • 写了「温暖」又写了「凛冽」——它只能挑一个,或者做个四不像
  • 写了「木吉他」又写「合成器铺底」又写「弦乐」又写「808 鼓」——四件东西抢同一段频率,出来一团糊
  • 写了「慢速」又写「律动强烈」——它不知道你到底要哪个

社区反馈的反模式也印证这点:一次塞十几个标签、把 Style 写成 200 字长文、用生僻词描述音色,都会让结果更不可控。

操作建议:写完先删一遍,顺序是先删形容感受的词(好听、高级、治愈),再删重复的词(温暖 / 温馨 / 暖色调留一个),最后删互相冲突的词。删完还超过十个词,说明你想要的东西太多了——那应该拆成两首歌。


一、可抄的风格词库

只给五个流派。这不是词典,是让你看懂”一组词会产出什么”的样本。

看完这五组,你应该能自己写第六组。这比背五十个流派名有用得多。

每组的格式都一样:可抄的词 → 它实际会产出什么 → 最容易翻车的地方 → 想调整时动哪个零件

1.1 中文都市民谣

中文都市民谣, 男声, 木吉他分解和弦, 电钢, 轻柔鼓刷, 慢速, 深夜感, 温暖干净的制作

它实际会产出什么:偏慢,没有强烈鼓点;吉他是一根根拨的(分解和弦)不是”唰唰”扫的;人声靠前能听清字;整首动态平缓,没有”炸”的段落。

最容易翻车的地方:副歌起不来。整条描述里没有任何一个词提示”这里要变大”,模型会把副歌也做得和主歌一样淡。解决办法在第四节。

想调整时动哪个零件:想更暖 → 动质感(加「磁带质感」);想更空 → 动编制(删掉电钢);想更有推进感 → 动编制(加「简单的贝斯线」),不要动速度。

1.2 City pop

80 年代日本 citypop, 女声, 电钢, funky 贝斯, 闪亮的合成器, 中速, 慵懒, 模拟磁带质感

它实际会产出什么:贝斯很活跃,是整首歌里最动的那条线;和弦比流行歌复杂,会有”听着有点甜又有点晃”的转折;高频偏亮,镲片明显;人声偏气声,不用力唱。

最容易翻车的地方:写了 citypop 但没写年代和质感,出来的会是一首”现代 R&B”,干净得没有味道。年代和质感这两个零件对这个流派是必填。

想调整时动哪个零件:想更复古 → 动年代(80 → 70 年代末)并把质感换成「黑胶质感」;想当 BGM → 动人声(改「无人声」或「哼唱」)。

1.3 Lo-fi 说唱底 / chillhop

lo-fi hip hop, 无人声, 慢速鼓组, 电钢琴循环, 黑胶噪音, 雨声, 放松, 温暖的低保真质感

它实际会产出什么:一段两到四小节的循环反复到结束;鼓是”松”的,故意不对齐拍子;高频被削掉一块,像隔着一层布;没有明显的段落变化——这是它的特点,不是缺陷。

最容易翻车的地方:你要的是”能放着写代码的背景音乐”,却把人声那格留空,结果人声一直在唱。这个流派必须明确写「无人声」——留空它会自己决定,多半会给你加。

想调整时动哪个零件:想更适合视频配乐 → 动编制(删掉雨声这类环境音,后期自己加更可控);想要情绪起伏 → 换流派(lo-fi 天生就是平的,别在它身上要起伏)。

1.4 合成器流行 / synthwave

80 年代 synthwave, 男声, 复古合成器铺底, 电子鼓机, 中速, 夜路驾驶感, 宽阔的混响

它实际会产出什么:一层持续的合成器从头铺到尾;鼓是机器味的,很规整,没有人打鼓的呼吸感;混响很大,像在一个大空间里;人声被推得靠后,融在音墙里。

最容易翻车的地方:混响大、人声靠后,中文歌词会糊成一片听不清。要中文人声,就把「宽阔的混响」换成「干净的人声」——两者只能选一个

想调整时动哪个零件:想人声听清 → 加「人声靠前 干净」同时删掉混响词;想更适合游戏或短视频 → 动情绪(「紧张」「追逐感」)并加快速度。

1.5 独立摇滚 / 民谣摇滚

独立摇滚, 男声, 失真吉他, 贝斯, 真实鼓组, 中快速, 有点糙, 现场感的制作

它实际会产出什么:有明确的主歌—副歌落差,副歌吉他会加满;鼓像真人打的,有轻重变化;人声偏用力,可能带一点破音;整体没那么”干净”,这是「现场感」这个词的功劳。

最容易翻车的地方:「有点糙」「现场感」会连带影响人声清晰度。如果歌词是这首歌的重点,这两个词要谨慎用。

想调整时动哪个零件:想更安静 → 动编制(失真吉他 → 木吉他),流派不动;想更”大” → 动编制(加「和声」「弦乐」),不要靠加形容词。

1.6 五组之外怎么办

看出规律了吗——每组词的骨架都是那七个零件,换的只是填空的内容。所以你不需要一本词典,你需要的是:找到流派名 → 用七个零件补全 → 生成、听、判断是哪个零件不对、只改那一个。

关于中文词和英文词:社区反馈一致认为,英文的流派名和乐器名识别率比中文高,即使你的歌词是中文。折中写法是流派、乐器、质感用英文,人声语言和情绪用中文写明。本篇为了好读用了中文,你实际用的时候可以把流派名换成英文对比一下。


二、逆向一首参考曲

2.1 先说清楚不能怎么做

不要写歌手的名字。 这不是道德建议,是两个层面的实际问题。

第一,它无效。 模型里没有”某位歌手”这个旋钮。你写下一个名字,它接收到的只是一串文本,输出一个模糊的、平均化的联想结果。表现出来就是:出来的东西和那个人没什么关系;写同一个名字两次,两首歌互相之间也没什么关系;而且你完全不知道该怎么改——因为你没写下任何一个可调的零件。

用名字换来的是不可复现,用七个零件换来的是可复现。 这是纯粹的工程差别。

第二,它踩红线。

  • 未经授权用 AI 克隆真人(尤其是歌手)的声音,是明确的红线。Spotify 在 2025-09-25 的政策发布中直接把它定性为”对艺人身份的剥削”,其冒名(impersonation)政策当日立即生效
  • 中国法下,自然人的声音受人格权保护(《民法典》人格权编规定声音参照适用肖像权保护的规定;具体条文编号本系列未核对原文,你要引用请自行核实条号)。
  • “拿别人的歌 + 明星音色做 AI 翻唱”同时踩三条线:录音版权、词曲著作权、声音/人格权。标注”AI 生成”不能免除这三项责任。

红线的详细展开在 篇一,这里只强调一句:“像谁”是错的问题,“像什么”才是对的问题。

2.2 正确的做法:把一首歌听成七个零件

拿出你想参考的那首歌,戴上耳机,听三遍。每遍只听一样东西。

第一遍:听编制。 能听出几件乐器(多数流行歌三到五件,不要多写)?从头铺到尾的是哪一件(这是”打底”的那件,最重要)?副歌比主歌多了什么(这个答案直接写进结构标签,见第四节)?

编制 = 打底那件 + 最多两件辅助。

第二遍:听节奏型。 快还是慢(不要猜 BPM 数字,用「慢速」「中速」「中快速」就够了,写数字更容易失控)?鼓密还是疏,有没有鼓?重拍是”咚—哒—咚—哒”这种规整的,还是有点晃、有点错位?

流派大半是从这一步判断出来的。节奏型是流派最硬的指纹。

第三遍:听人声位置。 人声浮在最前面还是陷在乐器里?干还是湿(湿 = 混响多,像在大房间里唱)?用力唱还是气声?有没有背景和声,副歌有没有变厚?

人声 + 质感

2.3 填空,填不出来就空着

听完三遍,照第零节那七格填。年代听录音的干净程度和鼓的味道,地域听语言和旋律走向,其余三遍里已经有答案。

填不出来的格子,就是你还没听出来的东西——空着,别瞎写。空着至少你知道那一格是随机的;瞎写会把结果带偏,而且你不知道是哪个词带偏的。

2.4 一个诚实的提醒

逆向出来的结果永远不会像那首参考曲,它只会像”那首歌所在的那一片区域”。这已经是你能拿到的最好结果——而且从版权角度看,这恰恰是你应该要的结果。

如果你的目标是”做出和某首歌一样的东西”,这个工具帮不了你,任何工具都帮不了你,而且那件事本身就有法律问题。


三、人声的控制

这一节的作用是帮你省点数——知道哪些是真能控的,就不会在不能控的东西上反复抽卡。

3.1 真的可控

  • 性别:「男声」「女声」基本都听,这是最稳的一个
  • 语言:「中文」「英文」有效,而且必须写——不写的话中文歌词也可能被唱出外国腔(第七节第 3 个案例)
  • 大致音域:「低沉」「明亮」「高亢」有效;写具体音高(“A3 到 E5”)无效,别写
  • 唱法:「气声」「念白」「呐喊」「假声」这类有明确演唱动作的词,多数时候有效
  • 和声:在结构标签里写「加和声」比写在 Style 里准,因为你能指定只在副歌加
  • 人声位置:「人声靠前」「干净的人声」有效,是解决”人声没存在感”的直接手段

3.2 半可控(值得试,但别指望)

  • 年龄感:「少年感」「沧桑」有时有效,有时被忽略
  • 沙哑程度:「微微沙哑」这种带程度限定的,命中率比「沙哑」高
  • 方言:基本别指望,出来的多半是带口音的普通话
  • 颤音、转音:写了它可能加,但加多少完全随机

3.3 基本不可控(别浪费点数)

  • 具体音色——你脑子里那个声音,没有词能描述准
  • “像某某人”——见第二节
  • 精确的换气点——但你可以间接控制,见第五节(换行就是断句)
  • 同一个人唱两首歌——每次生成的人声都是新的

3.4 关于”锁定同一个音色”

如果你的目标是做一张专辑、几首歌听起来像同一个人唱的,光靠描述词做不到。

调研当天(2026-07-23)在 Suno 官方 release notes 里查到的相关功能有两个,都是随 v5.5 于 2026-03-26 上线的:

  • Voices:录制或上传你自己的声音,然后让它用你的嗓音演唱
  • Custom Models:上传你自己作品集里至少 6 首曲子,训练一个属于你的模型变体

这两个功能的具体操作细节、点数消耗、可用档位,本系列没有逐条查证,所以不展开写。 你要用的话,去官方 release notes 和帮助中心当场确认。

⚠️ 无论用哪个,素材必须是你自己的声音或你有权使用的声音。用别人的声音训练,前面说的三条线一条不少。


四、结构标签的实战用法

三个可以直接抄的结构模板结构标签是社区经验,不是 Suno 官方规范语法流行三段式民谣叙事短视频 15 秒IntroVerse 1ChorusVerse 2ChorusBridgeChorusOutroIntro 木吉他独奏Verse 1Verse 2ChorusVerse 3ChorusOutro 渐弱直接从 Chorus 开始ChorusVerseChorus总长控制在30 秒以内生成后剪前 15 秒标签写法:中括号包住,独占一行,比如 [Verse 1] 或 [Chorus: 加满乐器]。冒号后的补充说明多数时候有效,但不保证

4.1 再说一次:这是社区经验,不是官方规范

[Verse] [Chorus] 这套写法,在 Suno 官方文档里没有规范定义(相关帮助文档目录 2026-07-23 查证时返回 404)。它是用户群体长期试出来的、被广泛验证有效的习惯用法。

所以下面所有内容的正确读法是”多数情况下有效”,不是”必须这么写”。哪天它突然不认了,不是你写错了。

4.2 基本写法

四条规则:

  1. 中括号包住,独占一行
  2. 放在它要影响的那段歌词的前面
  3. 标签本身不会被唱出来
  4. 1 到 3 个词最稳,越短越可靠
[Verse 1]
第一段主歌的词写在这里
每一行就是一个乐句

[Chorus]
副歌的词写在这里

标签用英文比用中文稳,即使歌词是中文——这也是社区的一致反馈。

4.3 三个可以直接抄的模板

模板一:流行三段式

Intro
Verse 1
Chorus
Verse 2
Chorus
Bridge
Chorus
Outro

适合:绝大多数你想做成”一首正经歌”的情况。副歌出现三次,是让人记住旋律的最低次数。

模板二:民谣叙事

Intro 木吉他独奏
Verse 1
Verse 2
Chorus
Verse 3
Chorus
Outro 渐弱

适合:歌词有故事线、想让人听内容的。特点是副歌来得晚——先用两段主歌把事情讲清楚,副歌才出现,情绪落差更大。本系列的贯穿案例《末班地铁》走的就是这个路子的变体。

模板三:短视频 15 秒

直接从 Chorus 开始
Chorus
Verse
Chorus
总长控制在 30 秒以内
生成后剪前 15 秒

适合:做视频配乐、做卡点素材。

要点是开头就得是最抓耳的那一段——短视频没有铺垫的时间。生成的时候留一点余量(做到 30 秒),后期再剪出最好的 15 秒。

4.4 参数化写法

在标签里加冒号,后面跟修饰语,只影响这一段,不动全局 Style

[Verse: 只有木吉他, 气声演唱]

[Chorus: 加满乐器, 有力的人声]

这是解决”副歌不炸”最直接的手段——在副歌标签里写清楚编制变化

⚠️ 冒号后的补充说明多数时候有效,但不保证。它和 Style 框里的词一样,是概率提示。

4.5 常见的段落标签

够用的就这几个:[Intro] [Verse] [Chorus] [Bridge] [Outro] 五个骨架标签;[Pre-Chorus] 是副歌前的过渡,想做”蓄力感”时用;[Instrumental] [Guitar Solo] 是纯乐器段落,下面不要写词;[Whispered] [Spoken] 是演唱方式,用在需要反差的地方。

不建议往上堆更多。 标签越多越冷门,被忽略的概率越高。

4.6 它不听你的时候怎么办

按这个顺序试,不要跳步

  1. 重新生成一次——大概三分之一的情况这样就好了,因为它本来就是概率的
  2. 把标签改短——[Chorus: 加满乐器,有力的人声,鼓组进入,弦乐铺底] 改成 [Chorus: 加满乐器]
  3. 把标签换成英文
  4. 改 Style 框而不是改标签——有些事(比如整体质感)是全局的,在段落级别拧不动
  5. 接受它——如果三次都不听,说明你要的东西超出了它的能力范围

最错误的做法是往里加更多标签。 这是社区反馈里最明确的一条反模式。


五、歌词怎么写才好唱

同样的意思,有的词好唱有的不好唱好唱不好唱每句字数接近七到十二个字有的三个字有的二十个字句尾押韵哪怕只是宽韵完全不押它会自己乱改断句常用字口语化的表达生僻字 多音字专有名词一句一个意象不塞太多信息一句里三个转折它会唱得赶自检方法:写完自己念一遍,念着别扭的地方它一定唱得别扭换行就是断句——你在哪里回车,它就在哪里换气

5.1 一条比什么都重要的规则

换行就是断句。你在哪里回车,它就在哪里换气。

这一条能解决你一半的歌词问题。

它不会自己判断”这句话到哪里应该停”。它把你的每一个换行都当成一个乐句的边界。所以:

  • 一行写太长 → 它会唱得很赶,字挤在一起
  • 一行写太短 → 中间会出现莫名其妙的空白
  • 该断的地方没断 → 它会在词语中间换气,听起来像喘不上气
  • 两行之间空一行 → 多数时候会被理解成一个更大的停顿

所以排版就是编曲的一部分。 写完歌词,你的换行位置已经把节奏定了七成。

5.2 四组对照

第一组:字数。 好唱是每句字数接近、七到十二个字;不好唱是有的三个字有的二十个字。

原因很简单——旋律是有小节的。字数差太多,它只能靠拉长或压缩塞进同一个小节,出来就是有的字被拖得很长,有的字快到听不清。不需要每句一样多,上下句差三个字以内就够了。

第二组:押韵。 好唱是句尾押韵、哪怕只是宽韵;不好唱是完全不押,它会自己乱改断句。

宽韵的意思是不用严格同韵母,听起来”顺”就行,「口」和「走」、「灯」和「人」都算。不押韵之所以会让断句乱,是因为韵脚是它判断”一句结束了”的重要线索——没有韵脚,它只能靠换行猜。

第三组:用字。 好唱是常用字、口语化;不好唱是生僻字、多音字、专有名词。中文特有的三个坑:

  • 多音字:「行」「重」「长」「乐」,它会读错,而且你没法纠正
  • 数字:「一」在不同位置读音不同,「2」它可能读”二”也可能读”两”
  • 中英夹杂:一句里混英文词,切换时会有明显卡顿

第四组:信息密度。 好唱是一句一个意象;不好唱是一句里三个转折,它会唱得赶。

歌词不是散文。「末班车的灯光有点旧」是一个画面,一句一个就够了;「末班车的灯光有点旧但是我想起了去年冬天你说过的话」是三件事,塞在一句里必然唱崩。

5.3 自检方法

写完之后自己念一遍。不用唱,就正常念,按你写的换行停顿。

念着别扭的地方,它一定唱得别扭。 这个方法准确率极高,因为你和模型面对的是同一份文本、同一个断句。念的时候注意三件事:需要抢气才念得完的句子太长了,拆成两行;念出来是另一个音的字是多音字,换掉;你自己都不确定该在哪停的地方,加个换行。

5.4 副歌的特殊要求

副歌要满足三条,缺一条都会”记不住”:

  1. 比主歌短——句子更短,字更少
  2. 重复——同一句词出现两次以上是正常的,不是偷懒
  3. 有一句是”歌眼”——最想让人记住的那一句,放在副歌开头或结尾

看贯穿案例的副歌:

今天也没什么不好
只是有点想早点睡觉
城市把我送到家门口
它就不再说话了

四句,每句 8 到 10 个字,「好」和「觉」押宽韵,全是常用字,一句一个画面。整首歌里它原样重复三次。

5.5 关于这首歌的诚实说明

《末班地铁》的歌词是人写的。 AI 负责的是编曲和演唱。

本系列不会给你”AI 全自动产出一首好歌”的暗示,因为那不是现在的真实情况。歌词这一层,你自己写,或者用通用的大语言模型辅助你写,都比让音乐模型自己发挥要可控得多。


六、局部返工

6.1 先判断:该局部改还是该重抽

这一节讲的是”歌基本对了,只有一段不行”的情况。

  • 重抽整首(回第零节改 Style):风格整体不对、人声不对、情绪不对、说不清哪里不对但就是不喜欢
  • 局部返工:整体对但某一段编制不对、结尾突然断掉、某一句吐字不清、长度不够

判断口诀:说得出是哪一段的问题,才做局部返工;说不出来就是 Style 的问题,回去改 Style。

绝大多数人的错误是反过来的——歌整体就不对,却在那里一段一段地修,点数全烧在修补上。

6.2 界面上的几个功能

⚠️ 这一小节的功能名称随版本变动很快。 下面只写调研当天(2026-07-23)能在官方 release notes 上佐证的内容,具体按钮位置和参数请以你当时看到的界面为准。

调研当天官方 release notes 记录的相关能力:

  • 上传音频:Pro / Premier 档支持上传最长 30 分钟的音频(免费档上限 8 分钟)
  • Add vocals / Add instrumental:给已有音频加人声或加伴奏
  • Remix:包含 extend(延长)、cover(翻做)、调速
  • Advanced editing:替换或新增段落

界面上你可能看到的按钮名(比如 Extend、Replace Section)和 release notes 里的分类名不完全对应,这很正常,不要纠结名称。你需要认的是”这个操作是延长、是替换一段、还是整体翻做”。

本系列没有查证的部分,因此不展开:各功能的点数消耗、单次生成的时长上限具体数字(官方 release note 未给数字)、每个功能在哪些档位可用的完整对照。

6.3 Remix 的授权坑(重点,第二次强调)

这是整个系列里最容易让人在发布阶段翻车的一条。

Suno 服务条款(最后修订日 2026-03-26,查证于 2026-07-23)明确写着:

  • Remix 属于你与 Remixer 的共同作品
  • 无论你是免费用户还是付费用户,Remix 只能用于合法的、内部的、个人的、非商业用途
  • 必须署名 Suno

翻译成人话:

你付了钱,也不代表 Remix 出来的东西能商用。 商用授权覆盖的是你自己生成的作品,不是 Remix 的产物。

所以如果你的这首歌最终要发行、要接商单、要放进带广告的视频,那么在返工的时候:

  • 优先用”改 Style 重新生成”或”替换段落”这类不改变作品归属的方式
  • 对 Remix 保持警惕,用之前先去当前的条款页确认它现在怎么写

6.4 另外两个和授权有关的坑

第一,授权不能追溯。

订阅之后,回头给你订阅之前生成的歌补商用授权——不行。

所以如果你打算发行,先订阅,再生成。顺序反了,前面做的所有歌都白做。

第二,一个还没落地但随时会来的变更。

有二手报道(Digital Music News,2025-12-22;Music Business Worldwide,WMG 和解日 2025-11-25)称,Warner 协议之后会有这些变化:

  • 免费档歌曲将不可下载,只能播放和分享
  • 付费档会有每月下载次数上限
  • 新的授权模型上线后,现有模型将被弃用

⚠️ 截至 2026-07-23,Suno 定价页上尚未出现下载次数上限的字样,说明该变更还未落地或未公开。这些是二手来源的预告,不是已生效的规则。

但对你的实际影响是:歌做好了就下载下来存好,不要留在云端等着”以后再说”。


七、失败案例拆解

五个最常见的翻车,和对应的修法症状改哪里整首歌听着像背景音乐人声完全没存在感Style 里加人声位置的描述比如 人声靠前、干净的人声副歌和主歌听不出区别在副歌标签里标注编制变化并把副歌歌词写得更短更重复中文咬字像外国人唱中文删掉英文词,改用常用字并在 Style 里写明 中文流行每次生成风格差太远完全不可复现零件写全七个或改用同一个 Persona 音色情绪不对,太欢快或太丧情绪词优先级低于流派词先换流派,再调情绪词

五组最常见的症状。每组按「症状 → 根因 → 改哪个词 → 改完变成什么样」写。

⚠️ 一个诚实前提:生成是概率性的,下面写的”改完变成什么样”是方向,不是保证。 同样的改动,你可能需要重新生成两三次才看到效果。

7.1 整首歌听着像背景音乐,人声完全没存在感

症状:歌是好听的,但人声像是混在伴奏里的一件乐器,歌词听不清,注意力集中不到人身上。

根因:Style 里全是乐器和氛围的词,七个零件里”人声”那一格几乎是空的——或者只写了「男声」这种最低限度的信息。人声位置这个维度,你没给任何指示,它就按流派的平均习惯来了。混响类的词(「宽阔的混响」「空间感」)会进一步把人声推远。

改哪个词

  • 在 Style 里补人声位置的描述:「人声靠前」「干净的人声」「清晰的咬字」
  • 同时删掉混响、空间、朦胧这一类词——它们和”人声靠前”直接冲突
  • 如果流派本身就是人声靠后的(synthwave、shoegaze、后摇),那是流派的问题,得换流派

改完变成什么样:人声会明显浮到前面来,能听清每个字;代价是整首歌的”氛围感”会减弱一些。这是个跷跷板,你只能选一头。

7.2 副歌和主歌听不出区别

症状:整首歌从头到尾一个样,没有”起来”的地方,听完记不住任何一句。

根因:两个原因叠在一起。

  • Style 里没有任何提示”这首歌需要有落差”——它默认做成平的
  • 歌词的副歌部分和主歌长得太像:句子一样长、信息一样多、没有重复

改哪个词

  • 在副歌标签里标注编制变化[Chorus: 加满乐器, 有力的人声]
  • 反过来在主歌标签里做减法:[Verse: 只有木吉他]
  • 把副歌歌词改得更短、更重复——句子砍到 8 个字以内,同一句出现两次

改完变成什么样:主歌会变得更空、更收,副歌进来的瞬间会有明显的”打开”感。落差是靠对比造出来的,把主歌做小比把副歌做大更有效,因为后者容易糊成一团。

7.3 中文咬字像外国人唱中文

症状:歌词是中文,但唱出来的腔调很怪,声调不对,个别字听起来像另一个语言。

根因:三个来源,按常见程度排序。

  • Style 里没有明确写语言和地域——“地域”这个零件空着
  • 歌词里混了英文词、英文缩写或数字
  • 用了生僻字、多音字,或者书面语太重的表达

改哪个词

  • Style 里明确写 「中文流行」「中文人声」,把地域零件补上
  • 删掉歌词里所有英文词,包括你觉得”很酷”的那两个
  • 把不确定读音的字换成常用字,把书面语改成口语

改完变成什么样:声调会明显正常,尤其是四声的起伏。但要有心理预期——中文咬字仍然是这类模型最弱的一环,“能听清、不出戏”就是当前的合格线,别追求播音级。

7.4 每次生成风格差太远,完全不可复现

症状:同一条描述抽十次,出来十种东西。你听到一个好的,想再要一个类似的,却再也抽不出来。

根因零件缺得太多。你留了三四个空位,每个空位它都在随机,几个随机叠在一起,方差就爆炸了。

改哪个词

  • 对照第零节的七个零件表,逐格检查哪一格是空的,补全
  • 特别注意最容易被忘的三格:年代、地域、质感
  • 如果对人声一致性有要求,考虑用第 3.4 节提到的音色锁定类功能(细节未查证,请以官方文档为准)

改完变成什么样:十次生成会收敛到”同一个区域里的十个变体”——差别只在细节,而不是完全不同的歌。这时候抽卡才真的有意义:你是在挑最好的那个版本,而不是在赌运气。

图 MU-14 在这一格写的是「或改用同一个 Persona 音色」。需要说明的是:Persona 是社区里对”锁定同一音色”这类功能的通称,本系列在官方 release notes 上查到的对应功能名是 VoicesCustom Models(均随 v5.5 于 2026-03-26 上线)。名称以你当时看到的界面为准。

7.5 情绪不对,太欢快或者太丧

症状:你写了「悲伤」,出来的东西还是挺欢快;或者你写了「温暖」,出来的却很压抑。

根因:这是最反直觉的一条——情绪词的优先级低于流派词

流派自带情绪基调。你写「funk」再加「悲伤」,它多半还是会做出一首偏欢快的 funk,因为 funk 这个词对模型来说携带的信息量远大于「悲伤」。情绪词只能在流派划定的范围里微调,不能扭转它。

改哪个词

  • 先换流派,再调情绪词。想要悲伤,就去找本身就偏悲伤的流派,而不是给欢快的流派加悲伤形容词
  • 情绪不够时,用编制帮忙:减乐器、慢速度、去掉鼓,比加十个情绪形容词有用
  • 大调小调这类词偶尔有效,可以试,但别指望

改完变成什么样:情绪会一步到位,因为你是从骨架上换的,不是在表面上贴标签。

这一条可以推广成一条通用规则当某个零件不听你的时候,去看它上游的那个零件是不是在压着它。 优先级大致是:流派 > 编制 > 情绪 ≈ 人声 > 质感。


八、动手:把《末班地铁》调到满意

这一节把前面七节用在一首具体的歌上。

如果你在 篇二 做过这首歌,直接拿你当时的版本继续;没做过也没关系,下面给了完整的起点。

再说一次这首歌的诚实边界:歌词是人写的,AI 负责编曲和演唱。

8.1 起点

篇二里给出的 Style 描述:

中文都市民谣, 男声, 木吉他分解和弦, 电钢, 轻柔鼓刷, 慢速, 深夜感, 温暖干净的制作, 微微沙哑的气声

歌词全文在篇二,这里只摘开头两段,本节所有改动都发生在这两段上:

[Verse 1]
末班车的灯光有点旧
照着我没洗的衣袖
站台风把广告吹得发抖
我数着还有几站到头

[Chorus]
今天也没什么不好
只是有点想早点睡觉
城市把我送到家门口
它就不再说话了

结构是 Verse 1 → Chorus → Verse 2 → Chorus → Bridge → Chorus → Outro,副歌原样重复三次——对照第四节的”民谣叙事”模板看,它是那个模板的变体。

8.2 第一步:零件盘点

按第零节的七格,把这条描述拆开:

零件现在写的是状态
年代——空着
地域中文
流派都市民谣
编制木吉他分解和弦、电钢、轻柔鼓刷
情绪深夜感
人声男声、微微沙哑的气声
质感温暖干净的制作

七格里有一格是空的:年代。

这不是错误——篇二故意留着它,让模型自由发挥。现在我们要收紧了。

8.3 对照一:补上年代

改动:在最前面加一个年代词。

当代中文都市民谣, 男声, 木吉他分解和弦, 电钢, 轻柔鼓刷, 慢速, 深夜感, 温暖干净的制作, 微微沙哑的气声

为什么这么改:唯一的空位补上,方差立刻收窄。用「当代」而不是具体年份,是因为这首歌本来就该听起来像现在的歌。

改完的方向:录音会更干净,不会突然给你一个 80 年代的糊味道;连续生成几次,版本之间的差别会明显变小。

如果你想要另一种味道,把「当代」换成「90 年代」试试——同一批歌词会带上一点旧唱片的质感,吉他会更闷一些。这是最省力的一个”换个味道”开关。

8.4 对照二:把人声推到前面

听完第一版,最容易出现的不满是:人声有点陷在吉他里,歌词听不太清。

对照第 7.1 节:人声零件写了「男声」和「微微沙哑的气声」,但没有写人声位置

改动

当代中文都市民谣, 男声, 人声靠前且干净, 木吉他分解和弦, 电钢, 轻柔鼓刷, 慢速, 深夜感, 微微沙哑的气声

注意这里同时做了一件事:删掉了「温暖干净的制作」

为什么删——因为新加的「人声靠前且干净」已经覆盖了”干净”这层意思,两个词并存就是重复,而重复的词会挤占其他零件的权重。这就是第 0.4 节说的”写完先删一遍”。

改完的方向:歌词会明显清楚,“没洗的衣袖""关东煮在锅里翻个身”这种细节听得清了。代价是整首歌的”氛围”会薄一点点——如果你更想要氛围,就把这个改动回退。

8.5 对照三:做减法(这一组最重要)

假设你在前两步之后,又忍不住加了几个词:

当代中文都市民谣, 男声, 人声靠前且干净, 木吉他分解和弦, 电钢, 轻柔鼓刷, 慢速, 深夜感, 微微沙哑的气声, 城市孤独感, 电影感, 弦乐铺底, 雨夜, 温暖, 高级的制作水准

十五个词。这就是第 0.4 节说的”打架”。

打架的具体位置:

  • 「深夜感」「城市孤独感」「雨夜」——三个词在说同一件事,互相稀释
  • 「弦乐铺底」和「木吉他分解和弦 + 电钢 + 鼓刷」——第四件乐器进来抢频率,中频糊成一团
  • 「电影感」和「人声靠前」——电影感通常意味着大空间和人声靠后,两者冲突
  • 「高级的制作水准」——形容你的感受,模型接不住,纯占位

删完之后

当代中文都市民谣, 男声, 人声靠前且干净, 木吉他分解和弦, 电钢, 轻柔鼓刷, 慢速, 深夜感, 微微沙哑的气声

回到九个词。这就是本篇的核心操作——加词你会做,删词才是进阶。

8.6 局部返工:副歌不够重

前面几步之后最可能剩下的问题是:副歌和主歌落差不够,整首歌太平。

这是第 7.2 节的症状。按那里的修法,不改 Style,改歌词里的段落标签

[Verse 1: 只有木吉他和人声]
末班车的灯光有点旧
照着我没洗的衣袖
站台风把广告吹得发抖
我数着还有几站到头

[Chorus: 加入电钢与鼓刷, 加背景和声]
今天也没什么不好
只是有点想早点睡觉
城市把我送到家门口
它就不再说话了

为什么这样有效:落差是对比造出来的。主歌做减法(只留吉他),副歌那几件乐器才有”进来”的感觉。如果只在副歌加东西而不在主歌减,出来通常是”两段都很满”。

如果标签被忽略,按第 4.6 节的顺序处理:先重生成一次,再把标签改短([Chorus: 加满乐器]),再换英文,都不行就回去改 Style。不要往标签里加更多词。

8.7 收尾

调到你满意为止,然后做三件事:把这一版的 Style 和 Lyrics 原样存进一个笔记(不要只留在浏览器);把音频文件下载到本地(原因见第 6.4 节);记下你改了哪几个词,下一首歌用得上。

到这一步,这首歌的 demo 阶段就结束了。它现在应该是”听起来对了,但还不够像正式发行的歌”——那是后期的活,交给 篇四


九、翻车速查(按”你听到的现象”查,不按术语查)

你听到的大概率是哪个零件先改这里
人声陷在伴奏里,歌词听不清人声(缺位置描述)Style 加「人声靠前且干净」,删混响类词
副歌起不来,整首歌很平结构(缺编制落差)主歌标签做减法,副歌标签标注编制变化
中文唱得像外国人地域(空着)Style 写明「中文流行」,删歌词里的英文
每次生成差别巨大多个零件空着对照七格逐个补,重点查年代、地域、质感
情绪完全不对流派压着情绪先换流派,别在原流派上加情绪形容词
唱得很赶,字挤在一起歌词(单行太长)拆行,每句 7–12 字,上下句差 3 字以内
在奇怪的地方换气歌词(换行位置)换行就是断句,调整回车位置
中间莫名其妙冒出一段标签(太多或太冷门)只留五个骨架标签,删掉其余
加了很多词反而更糟词打架删到十个词以内,先删形容感受的词
结尾突然断掉结构(没写 Outro)歌词末尾加 [Outro],或用延长类功能
想复现某个好版本但抽不出来零件缺得太多补全七格;人声一致性另见 3.4 节
一段不行想只改那一段——先判断是不是整体问题(见 6.1)

两条元规则,比上面任何一行都重要

  1. 说不出是哪一段的问题,就是 Style 的问题。 回去改 Style,别在那里一段一段修。
  2. 它不听你的时候,删词,不要加词。

十、下一步

这一篇你学到的:一条风格描述有七个零件(年代、地域、流派、编制、情绪、人声、质感),缺哪个零件它就在哪个维度随机;零件不是越多越好,超过十个词开始互相打架,写完先删一遍;参考曲要听成零件,不能写歌手的名字;结构标签是社区经验不是官方规范,1–3 个词最稳;换行就是断句;优先级是流派 > 编制 > 情绪 ≈ 人声 > 质感,下游拧不动的时候去看上游。

接下来去哪

  • 如果你的歌风格对了但听着糊——去 篇四。那是分轨、混音三个旋钮、母带,把 demo 变成能和别人的歌放在一起不吃亏的成品。
  • 如果你发现Suno 的档位或额度不够用,或者想知道除了它还有什么——去 篇五
  • 如果你还没做出过一首完整的歌——回 篇二,那边是从零开始的。
  • 如果你打算把歌发出去——先去 篇一看三条红线,再去 篇六走流程。先看红线,再动手发。

最后一句关于时效:本篇里的方法(七个零件、结构标签、歌词写法)属于社区经验,相对耐用;涉及功能名称、档位、条款的部分保质期约一个季度,请以你使用当天的官网页面为准。本篇未查证因而没有展开的有三处:Voices / Custom Models 的点数与档位、各返工功能的点数消耗、《民法典》声音权的具体条文编号。