Research Hub·← 返回索引research.jingyijun.com
Deep Research · Singing Voice & Human Voice AI

人声与歌声合成全景深度调研
音高 / 响度 / 情绪 / 时长 / 音色克隆 / 声乐技巧控制 × 数据 × 训练 × 产品版图

本报告系统梳理歌声合成(SVS)、歌声转换(SVC)、歌曲生成(Song Generation)与人声可控生成领域的研究工作、模型架构、数据采集与构造方法、SFT/RL 训练范式、评测基准、性能优化手段,以及全球产品与公司竞争格局,并对声乐专业术语(混声、头声、胸声、气声、闭合等)给出面向机器学习的可操作定义。

日期:2026-08-24 · 范围:2018–2026 学术论文 + 开源项目 + 商业产品 · 语言:中文(术语保留英文)
检索来源:arXiv / NeurIPS / ICASSP / ISMIR / GitHub / 官方文档 / 行业媒体 · 结论均附出处链接

0 · 执行摘要

一句话总结:人声/歌声生成在 2021–2023 年由「两阶段声学模型 + 神经声码器」的 DiffSinger 范式主导;2023–2024 年开源社区以 RVC / so-vits-svc 把音色克隆平民化;2024–2026 年主战场转移到 Token-LM 与 Flow Matching 的整曲生成(Seed-Music、YuE、SongGen、LeVo、ACE-Step、DiffRhythm、Mureka O1、Suno/Udio),并把后训练(RLHF/DPO、多偏好对齐、CoT 推理)引入音乐生成。可控性的前沿不再是「能不能唱」,而是「能不能精确控制」——音高曲线、响度包络、情绪标签、时长对齐、零样本音色、乃至声乐技巧级(mix / belt / breathy / falsetto / vibrato)的细粒度操控。

80.59 h
GTSinger:最大录音棚多语言多技巧歌唱数据集(NeurIPS 2024 Spotlight,浙大)
128.9 h
ACE-Opencpop:「AI 合成 + 专家调参」数据构造新范式的规模(Interspeech 2024)
~3.9 MOS
SVCC 2023 顶级系统自然度已达 ground-truth 水平,但相似度仍落后
$0.002–0.005
UMG–Udio 和解披露的单次生成许可费区间(2025.10)——行业定价模板
六个关键结论:
  1. 控制维度的「显式化」是分水岭。传统 SVS 用 variance adaptor 显式建模音高/时长/能量;LM 系整曲生成把控制交给 prompt,但牺牲了逐音符编辑能力——两条路线正在融合(ACE-Step 的 flow 编辑、LeVo 的 lead sheet 条件、Seed-Music 的三表示框架)。
  2. 声乐技巧成为新的数据护城河。GTSinger 把 mix voice / falsetto / breathy / pharyngeal / vibrato / glissando 六种技巧做成受控对照标注;VocalSet 提供技巧分类基线;商业引擎(SynthV 的 Vocal Modes、ACE Studio 的 Power/Soft/Breathy/Chest 参数)已把技巧做成产品参数。
  3. 数据工程决定上限。录音棚采集 → 人声分离(Mel-RoFormer SDR≈12dB)→ 强制对齐(AutoLyrixAlign 等)→ RMVPE/FCPE 提取 F0 → 质量过滤 → 合成数据自举(ACE-Opencpop 式「合成+人工调参」)构成标准流水线。
  4. 后训练范式从 TTS 迁移到歌唱。SpeechAlign(迭代 DPO/PPO)验证了 codec-LM 的偏好优化路径;LeVo 提出 multi-preference alignment(半自动偏好数据 + 后训练);Mureka O1 引入 MusiCoT 结构化推理;歌唱任务天然存在可验证奖励(唱词准确率、F0 对齐乐谱),适合 GRPO 类算法。
  5. 评测仍以主观 MOS 为金标准。SingMOS/SingMOS-Pro 是相关性最高的神经 MOS;客观指标中 chroma-alignment(CQT/CENS)与 speaker embedding 相关性最好;SVCC 2025 新增 singing style 任务并发现 ARLM+Diffusion 组合最优。
  6. 法律成为产品设计约束。Tennessee ELVIS Act(2024)、中国《人工智能生成合成内容标识办法》(2025-09-01 施行)、北京互联网法院「AI 声音第一案」(2024)共同推动「授权音库 + 内容标识 + 溯源水印」的工程默认项。

1 · 领域全景图

① 数据层 Data 录音棚采集(GTSinger/M4Singer/OpenCpop) · in-the-wild 挖掘+分离(Mel-RoFormer/UVR) · 合成自举(ACE-Opencpop) 标注:强制对齐 · F0(RMVPE/FCPE/CREPE) · 技巧/情绪标签 · 乐谱(score) · 质量过滤与去重 ② 表示层 Representation mel 谱 · 连续 F0/响度曲线 · phoneme 序列 · 乐谱 token(leadsheet) · SSL 特征(HuBERT/ContentVec/WavLM) 神经编解码 token(EnCodec/DAC/自研 codec) · semantic vs acoustic 双轨 token · CLAP/MERT 音乐语义 ③ 模型层 Models(四代技术路线) 两阶段 FastSpeech 系XiaoiceSing · ByteSing · FASTvariance adaptor + vocoder 扩散 / 流匹配系DiffSinger · VISinger2 · StyleSingerTCSinger(2) · DiTSinger · FM-Singer AR Token-LM 系Seed-Music · YuE · SongGen · LeVoMureka O1(MusiCoT) · Suno/Udio Latent DiT / Flow 系ACE-Step(DCAE+LinearDiT)DiffRhythm · HiddenSinger ④ 可控性层 Control(第 5 章深潜) 音高 F0 曲线 响度/动态 情绪 / 风格 时值 / 节奏 零样本音色克隆 声乐技巧 mix/belt… ⑤ 产品层 Products(第 11 章) 专业制作:Synthesizer V Studio 2 Pro · ACE Studio 2.0 · CeVIO · VOCALOID6 | 消费级:Suno v5.5 · Udio · Mureka O1 · Eleven Music · Lyria 翻唱/克隆:Jammable · Kits.AI · RVC 社区 | 中国:网易天音 · X Studio(小冰) · 天琴实验室 · 全民K歌 AI
图 1 · 人声/歌声 AI 五层全景:数据 → 表示 → 模型 → 可控性 → 产品。粉色高亮为当前研究增量最大的「声乐技巧控制」。

2 · 人声机理与声乐术语体系

要把「混声、头声、胸声、气声、闭合」这些声乐术语变成模型可学习的控制信号,必须先在生理机制 → 声学特征 → ML 特征三层之间建立映射。本章给出这一映射表,它是第 5.6 节技巧控制的方法论基础。

2.1 发声机理与声学特征

人声产生遵循 source–filter 模型:声带振动产生激励源(source,基频 F0 与谐波列),声道(咽喉、口腔、鼻腔)作为滤波器塑造共振峰(formants)。歌唱与说话的核心差异在于:

对应到 ML 特征:F0 轨迹(semitone 域)能量/RMS 包络mel 频谱 / CQTHNR / spectral tiltjitter/shimmer(声带周期微扰)formant 频率与带宽periodicity(WORLD 的 BAP/aperiodicity 参数)。这些正是 WORLD/pyworld、CREPE、RMVPE、FCPE 等 F0 提取器和声码器条件输入的基础。

2.2 声区体系:真声、假声、混声、头声、胸声、哨音

术语英文生理机制(简化)典型听感/用途可测声学线索
胸声Chest voice / modal register声带全长振动、闭合较紧、纵向质量参与多低中音区的「实」「厚」,流行主歌主力强谐波、低 spectral tilt 小(亮)、HNR 高
真声Modal voice即日常说话的默认发声模式,常与胸声音区重叠但概念不同自然、口语化演唱(如民谣)F0 低、动态小
头声Head voice声带边缘振动为主、环甲肌主导拉伸高音区明亮通透(美声上声区)高频谐波丰富、F0 高、能量略低
假声Falsetto声带仅边缘薄部振动、闭合不完全、有漏气轻盈缥缈的高音(男声假音流行常用)HNR 低(气感)、谐波弱、动态受限
混声Mixed voice / mix胸声与头声肌肉配比的连续混合,是换声点(passaggio)平滑过渡的关键技术流行/音乐剧高音「既实又高」的核心技巧;分 strong mix / light mix介于两者之间的频谱形态;GTSinger 将其列为六大受控技巧之一
哨音Whistle register声带极短部分振动(海豚音)极端高音装饰(Mariah Carey)F0 > C6,谐波极少接近正弦
咽音Pharyngeal voice会厌折叠收窄强化咽腔共鸣金属芯、穿透力(摇滚/戏腔相关)singer's formant 能量集中
关于「闭合」(vocal fold closure / adduction):这不是一种独立音色,而是所有上述音色的底层连续变量——从完全内收(pressed,挤压声)到不完全闭合(breathy,漏气)。在 CVT(Complete Vocal Technique)/EVT(Estill Voice Training)体系中分别对应 Neutral/Curbing/Edge 或 thyroid/arytenoid 控制轴。对建模者最有用的视角:闭合度 ≈ 声学上的「气声比例」,可用 HNR / aperiodicity 连续参数化——这正是 ACE Studio 把 Breath/Air 做成连续推子、DiffSinger 社区用 aperiodicity 曲线编辑的理论依据。

2.3 声乐技巧词典(面向 ML 的定义)

GTSinger(浙大,NeurIPS 2024 Spotlight)把六种「歌曲中最常用」的技巧做成了受控对照数据集;VocalSet(ISMIR 2018)覆盖 17 种标准/扩展技巧。下表合并两套本体并补充工业界常用的控制参数名。

技巧英文定义与听感声学/ML 特征数据与产品对应
颤音VibratoF0 的周期性调制(5–7 Hz,幅度 ±20–100 cents),长音自然出现F0 局部正弦检测;幅度/频率/延迟 onset 三参数可显式合成GTSinger 技巧①;ACE Studio Vibrato 工具(幅度/相位/频率/包络四手柄);SynthV 自动 vibrato 深度
直声Straight tone无 vibrato 的平直长音,常作 vibrato 对照组F0 平稳度GTSinger 对照;VocalSet 分类基线类
气声Breathy voice声门不完全闭合、明显气流噪声的轻声唱法HNR↓、aperiodicity↑、高频噪声抬升GTSinger 技巧③;ACE Breath/Air 参数;SynthV Breathy/Whispery vocal mode
假声(唱法)Falsetto见 2.2;流行中作为音色选项同上GTSinger 技巧②;ACE Falsetto 参数;SynthV Airy mode
混声Mixed voice (mix)见 2.2中间态频谱;需受控对照才能标注GTSinger 技巧①(受控对照设计是其核心贡献);ACE Verse25 引擎 Power/Chest
咽音Pharyngeal见 2.2;金属质感singer's formant 增强GTSinger 技巧④
滑音Glissando / slide音高连续滑动连接两音F0 连续曲线(无阶跃)GTSinger 技巧⑥;SVS 中由 pitch curve 编辑实现
怒音/嘶吼Growl / distortion假声带(室带)振动叠加或失真效果非线性噪声、亚谐波MVD 数据集(金属嘶吼分类);YuE 论文展示 zero-shot death growl 能力
气泡音Vocal fry极低频不规则振动(<50 Hz)脉冲间隔高度不均VocalSet 分类类;说话韵律研究常见
强声Belt高音区保持胸声主导的高强度唱法(音乐剧标志)高能量 + 高 F0 + 明亮频谱VocalSet 类;SynthV Belt mode;ACE Tension/Energy 参数
花腔转音Melisma / riff & runs单音节跨多个音符快速演唱音符级 F0 序列密度ACE-KiSing 数据集专门强化(27% 乐句含 melisma vs Opencpop 1.5%)
吸气唱法Inhaled singing吸气时发声的扩展技巧反向气流、噪声主导VocalSet 扩展技巧类
换气Breath (aspiration)乐句间/句中的呼吸声——真实感的隐形支柱宽带噪声事件检测与插入ACE Studio 显式 breath 参数与自动呼吸插入;SVS 数据清洗时须决定保留/剔除
说唱Rap节奏化准语音演唱F0 平坦、节拍对齐强SynthV 1.9 加入 Rap 支持;ACE Studio 多语言 Rap 音源;M4Singer 含说唱风格
戏腔(Chinese opera timbre)戏曲化行腔润色(中国特有需求)装饰音密集、咽腔共鸣强全民K歌「AI 戏腔唱金曲」功能;M4Singer 含戏曲风格子集
标注难点:技巧在真实歌曲中高度重叠且连续变化(一篇 2026 年 SVC-vibrato 控制工作指出 pitch 类技巧与 timbre 类技巧在时间上经常同时出现),因此 GTSinger 采用「同一旋律 × 有/无某技巧」的受控对照录制来获得干净监督信号;in-the-wild 标注则依赖 KVT 这类众包 tag(70 个 vocal tag 中仅 6 个与技巧相关,粒度粗)。这是「学术受控数据」与「产业规模数据」之间的根本 trade-off。

3 · 任务定义与技术路线演进

3.1 任务谱系

任务输入 → 输出控制粒度代表系统
SVS 歌声合成乐谱(音素+音符+时值)+ 音色 → 歌声逐音符级,最强可控性XiaoiceSing、DiffSinger、SynthV/ACE Studio 引擎
SVC 歌声转换源歌声 + 目标歌手参考 → 换音色歌声保留源演唱表现力,换 timbreso-vits-svc、RVC、DDSP-SVC、seed-vc、SVCC 参赛系统
STS 说转唱说话音频 + 旋律/乐谱 → 歌声从语音迁移韵律到歌唱NANSY-SVS、AlignSTS、GTSinger STS benchmark
Song Generation 整曲生成歌词 + 文本描述(±参考音频)→ 人声+伴奏整曲prompt 级,弱细粒度控制Suno/Udio、YuE、SongGen、LeVo、ACE-Step、DiffRhythm、Mureka
SVS 零样本化乐谱 + 几秒参考音色 → 任意人演唱音符级 + 零样本音色TCSinger(2)、StyleSinger、SoulX-Singer(2026)、Seed-Music Leadsheet2Vocals
歌声编辑已有歌声 + 局部修改指令 → 编辑后歌声局部 inpainting / flow 操作Seed-Music 后期编辑、ACE-Step repaint/lyric edit、SynthV 参数面板
实时变声/K歌流式输入 → 低延迟转换输出<100ms 级延迟约束w-okada voice-changer、DDSP-SVC realtime、StreamVC、Voicemod

3.2 四代技术路线时间线

2004–2016202020222023202420252025–262026 拼接/HMM/DNNVOCALOID · UTAUNNSYS · DNN-SVS 两阶段 FastSpeechXiaoiceSing · ByteSingFAST · Muskits 扩散系爆发DiffSinger(AAAI22)VISinger/VISinger2 开源 SVC 社区so-vits-svc · RVCDDSP-SVC · SVCC23 风格与技巧StyleSinger(AAAI24)TCSinger · GTSinger Token-LM 整曲Seed-Music · YuESongGen · LeVo Flow / DiTACE-StepDiffRhythm 后训练时代Mureka O1 CoTLeVo 偏好对齐 范式迁移:显式声学建模 → 生成式先验 → 规模化 token 建模 → 推理时计算与偏好对齐 对应可控性变化:手工参数(UTAU 调教)→ 曲线编辑(pitch editor)→ prompt 控制 → prompt+曲线混合控制与 RL 对齐
图 2 · 歌声生成技术路线时间线(上排:学术 SVS 主线;下排:社区/产业主线)。

3.3 三大建模范式的取舍

维度两阶段(acoustic model + vocoder)扩散 / Flow Matching(latent)AR Token-LM
可控性★★★★★ 显式 F0/duration/energy 条件;可逐帧编辑
代表:XiaoiceSing、DiffSinger variance 分支
★★★☆☆ 条件注入后仍难精确约束;需 flow 编辑/ControlNet 补救
代表:ACE-Step、HiddenSinger
★★☆☆☆ prompt 级控制;细粒度靠特殊 token
代表:YuE、SongGen、Suno
音质上限高(NSF-HiFiGAN/BigVGAN 成熟)但过平滑风险最高之一;latent 扩散保真度好受 codec 上限约束;LeVo 自研 codec RTF 0.09 已接近可用
推理速度快(RTF ≪ 1,可实时)中(少步 FM/DiT 可 15× 于 LLM 系:ACE-Step A100 上 4 分钟歌约 20 秒)慢(token 逐个生成),需并行解码或小 codec 帧率
长程结构弱(依赖外部乐谱编排)中(全局条件 + 分块注意力)强(LLM 天然长上下文;MusiCoT 先出结构再出 token;YuE 结构渐进条件)
数据需求强标注乐谱数据(稀缺!)大规模弱标音频即可起步海量 in-the-wild 歌曲 + MSS 分离伪 stem
典型失败模式过平滑、vibrato 丢失歌词咬字不清(靠 REPA 类语义对齐损失缓解)幻觉词/漏词、人声伴奏混叠(track-decoupled 解耦缓解)

4 · 代表性模型与研究工作

4.1 两阶段与扩散系 SVS 主线

XiaoiceSing(Interspeech 2020,微软)确立了 FastSpeech 式「频谱+F0+时长一体化」的 SVS 基线;ByteSing 用时长分配 encoder-decoder + WaveRNN 工程化。VISinger(ICASSP 2022)/ VISinger2 把 VITS 的端到端 VAE+flow+NSF 架构引入 SVS,直接从乐谱端到端生成波形,成为 ESPnet-Muskits 工具包的两大基线之一。

DiffSinger(AAAI 2022,浙大)是本领域引用最高的工作:用浅扩散机制(shallow diffusion)——先用简单 MSE decoder 预测 mel 谱,再从预测结果与真值扩散轨迹的交点处启动少量去噪步——同时解决过平滑与推理慢。其影响远超论文本身:

后续扩散/生成式 SVS 变体:Multi-Singer DiffSinger(多歌手)、RefuseSinger(参考歌声引导)、Learn2Sing 2.0(说→唱迁移)、SmoothSinger(多分辨率条件扩散)、LAPS-Diff(语言感知韵律风格)、HiddenSinger(neural codec latent 扩散)、DiTSinger(ICASSP 2026,RoPE+qk-norm 的 DiT 系统性 scaling + 隐式对齐)、FM-Singer(2026,flow matching 修正 cVAE latent mismatch)。风格侧:StyleSinger(AAAI 2024)做零样本风格迁移 SVS;TCSinger(EMNLP 2024)/ TCSinger 2实现 audio+text prompt 双模态风格的零样本 SVS(覆盖唱法/情绪/节奏/技巧/发音五维风格);AlignSTS 做 rhythm-free 的说转唱。

4.2 Token-LM 系歌曲生成(2024–2026 主战场)

Seed-Music(字节 Seed,arXiv 2409.09214,2024-09)是目前公开细节最完整的工业框架:三种中间表示(symbolic token / audio token / vocoder latent)× 三条流水线:

YuE(HKUST × M-A-P,arXiv 2503.08638,Apache 2.0):基于 LLaMA2 的开源整曲基座,万亿 token 预训练,可生成最长 5 分钟带人声歌曲。三项关键设计:track-decoupled next-token prediction(人声/伴奏双轨并行 token 流,防止密集器乐淹没人声)、structural progressive conditioning(按 [verse]/[chorus] 分段渐进条件保证长程一致性)、多任务多阶段预训练配方;支持 ICL 风格迁移(city pop → 英文 rap 保伴奏)与双向生成;社区展示出未专门训练过的 scatting、death growl、多声部阿卡贝拉等涌现能力。2025-06 加入 LoRA 微调。

SongGen(ICML 2025):单阶段 AR transformer 文本到歌曲,混合模式(mixed mode)与双轨模式(dual-track mode)两种 token 排布的系统对比实验给出模式选择洞见;支持 3 秒参考音色克隆;完全开源(16kHz/30s 版本)。

LeVo(腾讯 AI Lab,arXiv 2506.07520):song generation LM + 音乐编解码器(Music Codec,RTF 0.0902,比 MuCodec 快约 7 倍);双轨/混合 token 并行预测(优于 SongGen 的 interleaved 方案在长曲上的表现);核心贡献是 multi-preference alignment——半自动构建多维偏好(整体质量/旋律吸引力/人声-伴奏和谐/结构清晰度/音质/歌词贴合)数据并进行后训练,还支持偏好向量插值以平衡不同音乐属性。主观评测全面领先开源系统,LYC(歌词贴合)超出 Suno V4.5 0.21 分。

Mureka O1 / V6(昆仑万维,2025-03-26):全球首个引入思维链的音乐模型。MusiCoT 基于 CLAP 表示,在细粒度音频 token 预测之前先生成整体音乐结构的「思考链」,提升结构连贯性与配器精度;训练含 RL(策略优化器:梯度压缩、探索利用平衡)与 CoT 数据集;V6 基座引入自研 ICL 强化人声质感,支持 10 语种、歌曲参考 prompt 与音色克隆;开放 API + 模型微调服务。

ACE-Step(ACE Studio × StepFun,arXiv 2506.00045,Apache 2.0,3.5B):「音乐的 Stable Diffusion」路线——Music-DCAE(改编自 Sana 的深度压缩自编码器,latent 约 10.77 Hz)+ Linear DiT + 条件流匹配(FM)损失 + REPA 式语义对齐辅助损失(DiT 第 8 层特征对齐 MERT/mHuBERT,显著改善咬字)。A100 上 4 分钟歌曲约 20 秒(比 LLM 基线快 15×)。原生支持 remix、repaint(时间轴 inpainting)、歌词编辑等 flow 操作级控制,并示范 LoRA / ControlNet 式下游扩展(如 lyric-to-vocal 合成、text-to-sample)。1.5 版(2026-02)演进为 2B DiT + 4B LM 混合架构。DiffRhythm(西工大 ASLP,2025)则用纯 latent diffusion 实现 8× 实时的全曲生成。

4.3 SVC 歌声转换生态(音色克隆主力)

系统架构要点特色
so-vits-svcSoft-VC(HuBERT soft units)内容特征 + VITS(VAE + normalizing flow + 判别器)+ NSF 源滤波解码器2023 年现象级开源项目(>15k stars);可选 shallow diffusion 提升自然度;训练成本高、已归档但仍是效果基准
RVC(Retrieval-based VC)同族架构 + 检索增强:推理时从训练集 HuBERT 特征索引中检索近邻并按比例混入检索混合让输出更贴近目标歌手的演唱风格分布;训练快(小时级)、消费级显卡可训;衍生 v2 与庞大 WebUI 生态,是「AI 翻唱」事实标准
DDSP-SVC可微分数字信号处理(谐波+滤波噪声)轻量合成器 + ContentVec;后期版本接 shallow diffusion 或 rectified flow(reflow)增强训练资源低一个数量级、实时变声资源占用低于 so-vits;GUI 采用滑窗+SOLA 拼接+上下文参考实现准实时
seed-vc(字节)DiT 扩散变换器 zero-shot VC零样本克隆 + 流式实时变声分支;歌声场景表现好
InvoxSVC(2025)Latent Flow Matching + in-context learningany-to-any 零样本 SVC,客观/主观均超 so-vits-svc
kNN-VC / FreeVC / StreamVCkNN 特征替换 / VITS 变体 / Google 端侧流式分别代表极简路线、单阶段路线与 on-device 低延迟路线
SVC vs SVS 的产品学分工:SVC(RVC 类)适合「有干声、要换人」(翻唱、修音、demo 快速试唱);SVS(SynthV/ACE 类)适合「只有谱子,无真人」(虚拟歌手、创作工具)。ACE Studio 官方对比文章将两者定位为互补管线:先用 Vocal-to-MIDI 从哼唱提取 MIDI+歌词 → SVS 渲染 → (可选)RVC 换音色。

4.4 模型对比总表

系统机构/年份范式控制能力开源
DiffSinger (+OpenVPI)浙大 2021 / 社区至今浅扩散两阶段乐谱级 + pitch/variance 曲线编辑MIT 开源
VISinger2Microsoft 2022VAE+flow 端到端乐谱级未开源
StyleSinger / TCSinger 2浙大 2024–25扩散 + 风格编码零样本风格(唱法/情绪/节奏/技巧)开源
Seed-Music字节 2024三表示混合 AR+Diffusionleadsheet 符号编辑 + 音频 prompt + 后期 inpainting闭源(豆包内)
YuEHKUST/M-A-P 2025LLaMA2 AR,track-decoupled歌词/tag prompt + ICL 风格迁移Apache 2.0
SongGenCASIA 等 ICML 2025单阶段 AR歌词+描述+3s 克隆;mixed/dual-track 对照开源
LeVo腾讯 AI Lab 2025AR + 自研 Music Codecprompt + 多维偏好插值开源(songgeneration)
Mureka O1/V6昆仑万维 2025AR + MusiCoT 推理 + RL参考歌曲 prompt + 音色克隆 + API/微调API 商业
ACE-StepACE Studio×StepFun 2025DCAE + Linear DiT + FM + REPAtag/歌词/时长 + repaint/remix/ControlNet/LoRAApache 2.0
DiffRhythm西工大 2025Latent Diffusion 全曲歌词+风格,8× 实时开源
Suno(v5/v5.5)Suno Inc. 2023–26闭源(推测 AR/LM 混合)prompt/personas/stems 导出商业订阅
RVC / so-vits-svc / DDSP-SVC社区 2023SVC 三件套音色克隆 + 实时变声MIT/开源

注:Suno/Udio 未发表技术报告,业界普遍推测为「语义 token LM + 声码/扩散解码 + 大规模许可/爬取歌曲数据」的组合;本报告不对其内部架构作确定性断言。

5 · 六大控制维度深潜

5.1 音高控制(Pitch Control)

音高是歌声区别于语音的第一变量,也是所有 SVS 系统的「第一公民」。控制手段按显式程度分三层:

(a)乐谱级:音符 → F0 的自动演绎

(b)曲线级:逐帧编辑(专业制作标配)

(c)Token 级:LM 系统中的音高

Auto-Tune 式修正与数据视角:工业界还有一条隐秘的数据红利——大量商业歌曲经过 pitch correction(Melodyne/Auto-Tune),导致挖掘数据中的 F0 过于平直;训练前需要检测并权衡是否保留「修音痕迹」,否则模型学到的 vibrato 分布会被系统性压扁。

5.2 响度控制(Loudness / Dynamics)

手段说明代表
能量/响度预测器variance adaptor 中与 duration/pitch 并列的 energy 分支,从乐谱预测逐帧 RMSXiaoiceSing、FastSpeech2-SVS 一脉
强度曲线条件把 intensity/loudness curve 作为时间对齐条件加入去噪过程Seed-Music 明确支持 "melody contours, intensity curves" 类时变条件注入 diffusion
产品级动态参数连续推子控制乐句动态包络(渐强渐弱 messa di voce)SynthV Loudness/动态参数;ACE Studio Energy/Tension 参数自动化
STS 能量对齐说转唱时把说话能量对齐到目标歌唱响度轮廓AlignSTS(rhythm-free STS)
混音一致性生成人声与伴奏的相对响度(LUFS 归一化、sidechain ducking);LeVo 主观维度之一就是 vocal-instrument harmony整曲生成的隐性难题:人声过响/过闷是 Suno 类产品的常见差评点

工程要点:训练数据的响度分布高度依赖录音链路(麦克风/压缩器/mastering),需要在预处理阶段做 LUFS 统计与归一化策略设计(全局 vs 分歌手归一化),并在推理端提供用户侧 gain 匹配(如 K 歌场景的伴奏-人声自动平衡)。

5.3 情绪控制(Emotion / Style)

5.4 时长控制(Duration / Timing)

5.5 音色克隆(Timbre Cloning)

音色控制有两条互补路线:

路线机制优势短板
SVC 重灌(synthesize then convert)先用任意音色 SVS 出干声,再用 RVC/so-vits/seed-vc 转成目标音色目标音色保真度高(RVC 检索增强贴近目标唱法);目标只需几分钟~几小时干声两段误差累积;F0 范围不匹配会失真(男转女需移调);表现力受源演唱限制
零样本 SVS(zero-shot singing synthesis)声学模型条件于 singer embedding(GE2E/d-vector/ECAPA/RawNet3)或参考 encoder;训练时多歌手 + speaker augmentation 解耦一次生成即为目标音色,保留乐谱级控制;SECS 相似度可优化需要大规模多歌手带谱数据(稀缺);跨音域泛化难;「音色-技巧-F0」纠缠
定制 voicebank(fine-tune / LoRA)目标歌手少量录音微调基座(DiffSinger 微调、ACE Studio 用户上传样本训练自定义音源、YuE LoRA)效果上限最高;商业授权清晰时可形成资产采集成本高;过拟合小数据;版权敏感
关键技术问题——解耦:零样本克隆的核心是 content/timbre/F0/style 四因素解耦。SVC 用 ContentVec(抑制说话人信息的 HuBERT 蒸馏)+ 显式 F0 输入实现;SVS 靠多歌手数据 + speaker embedding + 技巧标签;整曲生成靠 track-decoupled token 与 codec 信息瓶颈。RVC 的检索混合本质上是承认内容特征仍残留风格信息,于是用目标域特征近邻「拉回」分布——一个简单却极其有效的工程补丁。

5.6 技巧控制(Vocal Technique Control)——当前最前沿

技巧控制的目标:给定乐谱 + 「这段用 mix,那段换 falsetto,长音加 vibrato」的指令,模型按技巧演绎。方法谱系:

  1. 受控对照数据 + 技巧标签:GTSinger 是标杆——六种技巧 × 同旋律对照 × 音素级标注,配套四个 benchmark(technique-controllable SVS、technique recognition、style transfer、STS)。其 technique-controllable SVS 基线证明:把音素级技巧 embedding 注入 DiffSinger 类声学模型即可实现可控合成,且 recognition 准确率可作为控制保真度的客观代理。
  2. 连续参数化合成:不学离散标签,而是把技巧映射到连续声学参数轴——vibrato(幅度/频率/相位)、breathiness(aperiodicity/HNR)、belting(能量+频谱 tilt)、闭合度(HNR 连续值)。WORLD 声码器的参数化使这条路线可直接落地为产品推子(ACE Studio 的 Breath/Air/Falsetto/Tension/Energy/Formant;Verse25 引擎的 Power/Soft/Breathy/Chest + breath noise)。优点是可解释、可插值、可自动化;缺点是各轴不完全正交。
  3. 技巧转换(technique transfer):VocalSet 论文展望的任务——直声↔vibrato、清声↔气声互相转换。2026 年已出现专门工作(如基于 VocalSet 的 SVC vibrato 表达控制,把 pitch 类技巧与 timbre 类技巧分开独立控制以提升正交性)。
  4. 涌现式技巧:YuE 团队报告 scatting、death growl、阿卡贝拉和声等未专门训练的技巧在大规模 LM 上涌现——提示「数据规模 + 多样性」本身是一种技巧获取途径,但不可控、不可验证,只能事后发现。
  5. 技巧识别器作为奖励/过滤器:技巧分类器(VocalSet CNN 基线、GTSinger Tech-Recognition benchmark)可以反过来当数据清洗过滤器和 RL 奖励模型——见第 7 章。

6 · 数据工程全链路

歌声数据是整个领域最硬的瓶颈:SVS 需要「音频 + 乐谱 + 音素对齐」三重强标注,天然稀缺;技巧/情绪标注进一步抬高成本。本章按采集 → 挖掘分离 → 标注对齐 → 清洗筛选 → 构造组合五段展开,最后给出公开数据集大全。

6.1 采集(Collection)

6.2 挖掘与分离(Mining & Source Separation)

In-the-wild 歌曲是规模化的唯一途径(YuE 万亿 token 预训练即依赖此类数据)。核心工具链:

模型/工具要点角色
Mel-RoFormer / BS-RoFormer字节 SAMI;Band-Split/Mel-band 前端 + RoPE 层级 Transformer 掩码估计;SDX'23 冠军;MUSDB18HQ 人声 SDR ≈ 12 dB(Mel 版较 BS 版再 +0.5dB)当前人声分离 SOTA;audio-separator/UVR 的默认高质量模型
Demucs v4(htdemucs)Meta 时域/频域混合 U-Net4-stem 快速批量分离的经典选择
MDX-Net 系列频域 CNN,速度快显存低UVR5 内置;大批量预处理
UVR5 / audio-separator图形化/命令行分离套件,聚合上述模型 + 后处理(去混响 MDX23C、去回声)SVC 社区数据准备的事实标准
分离残留是隐形毒药:伴奏泄漏会让模型学会「背景乐器幻听」。常见对策:二次分离串联(vocal→instrumental 反残差相减)、VAD/歌唱检测过滤纯器乐段、SNR 代理指标过滤、或干脆只把分离数据用于预训练、微调阶段只用录音棚干声。

6.3 标注与对齐(Annotation & Alignment)

6.4 清洗筛选(Filtering)

6.5 构造与组合(Construction & Mixing)

除直接采集外,三条已被验证的构造路线:

  1. 「合成 + 专家调参」自举(ACE-Opencpop 范式,Interspeech 2024):以 ACE Studio 合成 Opencpop 同款乐谱的 30 个虚拟歌手版本,由专业调教师修正 AI Pitch、vibrato 深度、呼吸与音节时长,再经音域合理性过滤,得到 128.9 小时 / 30 歌手的多歌手数据集(原版仅 5.2h 单人);实验证明其预训练显著优于 M4Singer 预训练迁移。这条路线把「数据生产成本」从录音棚转移到调参人力,且乐谱免费继承——human-in-the-loop 数据工作流的教科书案例
  2. 伪标签自训练:用现有 SVS 给挖掘数据生成乐谱伪标(score-free distillation),或用 MSS 分离 stem 构造多轨训练样本(Seed-Music 明确使用 MSS 获得 stem-level 训练样例)。
  3. 增强合成:pitch-shift / formant-shift(扩音域与音色多样性,注意会破坏绝对音高先验需谨慎)、EQ/压缩模拟不同录音链路、房间脉冲响应加混响、codec 徊环(MP3/AAC 二次编码抗压缩失真)、速度微扰。SVC 社区还流行「说话数据预训练 + 歌唱微调」(cross-domain SVC,SVCC 证实有效但上限低于 in-domain)。

组合策略:多源数据的配比决定能力边界——经验上「录音棚强标数据定上限、挖掘数据保多样性、合成数据补规模」三层金字塔;训练时按数据置信度加权采样,并对合成/挖掘数据施加 dropout 式随机降权防止分布偏移。LeVo 消融显示指令对齐噪声(歌词抽取/结构识别错误)是开源系统与闭源的剩余差距主因之一,印证「数据管线噪声 > 模型架构」的判断。

6.6 公开数据集大全

数据集年份语言时长(h)歌手数乐谱特殊标注许可
NUS-48E2013EN1.912说唱配对研究限定
PJS2017JP1.41音素级研究
NHSS2019EN/KO4.8(歌)10说唱配对;SVCC23 底座研究限定
JVS-MuSiC2020JP2.3100每歌手仅 ~0.02hCC
Kiritan / Ofuton-P 等 JP 系2021–22JP≈1–2 各1 各UTAU 生态研究限定
KiSing-v12021CN0.71CC-NC
OpenSinger2021CN5066挖掘型CC-NC
Opencpop2022CN5.21✓ 精细人工音素对齐;DiffSinger 标准基准CC-NC-ND
PopCS2022CN5.91✗(F0 代替)长曲连续建模CC-NC
M4Singer2022CN29.82010 种风格(美声/民族/流行/戏曲等)CC-NC
SingStyle1112023CN/EN/IT12.88风格标注受限
VocalSet2018EN10.12017 种声乐技巧×5 元音×4 情境;技巧分类基线研究
Phonation Modes2017EN4breathy/pressed/flow/neutral 声门模式研究
KVT2022KO18.8511470 个 vocal tags(含 6 个技巧类)众包研究
GTSinger20249 语种80.5920✓ realistic6 技巧受控对照 + 音素级 + 全局风格 + 16.16h 配对语音CC BY-NC-SA
ACE-Opencpop2024CN128.930✓ 继承合成+专家调参CC-NC
ACE-KiSing2024CN/EN32.53427% melisma 乐句CC-NC
MUSDB18(-HQ)2017/19EN 多~21150 曲分离基准 stems受限/NC
DALI2018多语种歌词-音频时间对齐(挖掘数据对齐监督)研究申请
CtrSVDD2024CN/JP 混合底座47.6(clip)14 种 SVS/SVC 伪造系统的 deepfake 检测基准研究
Emilia(对照)2024101 语种101k(语音)语音侧大规模流水线范式参考(非歌唱)CC BY-NC / Apache

趋势解读:① 规模竞赛已从「小时数」转向「受控维度」(技巧/情绪/配对语音);② 中文资源最丰富(产业驱动),日语 UTAU 生态贡献了大量单歌手精品;③ 许可普遍 NC,「可商用的合规歌唱数据」仍是巨大空白,也是厂商的核心壁垒。

7 · 训练方法:预训练 → SFT → 偏好优化 / RL

7.1 预训练目标

范式损失备注
回归声学模型L1/L2(mel) + 辅助 pitch/duration/energy NLL过平滑根源;必须靠 GAN/vocoder/扩散补救
GAN 声码器对抗 + 特征匹配(HiFi-GAN 系、NSF-HiFiGAN 歌唱专用源滤波分支、BigVGAN)vocoder 与 acoustic 联训(VISinger/VITS 系)或两段式均可
扩散噪声预测 ε-MSE;浅扩散变体只去噪到先验交点DiffSinger 核心;推理步数与质量的权衡由 scheduler 决定
Flow MatchingL_FM = E‖v_θ(x_t,t,c) − (x_0 − z)‖²,线性概率路径 ODEACE-Step:FM + REPA 语义对齐损失(DiT 中间层 vs MERT/mHuBERT 余弦),显著改善咬字与音乐连贯性——「表征对齐当正则」是值得抄的通用技巧
AR token LMcodec token 的交叉熵(可分层:semantic 先行、acoustic 并行/交错)track-decoupled(YuE)、parallel 双轨(LeVo,优于 interleaved 长曲表现)、delay pattern 等排布是关键超参
Masked generative掩码 token 迭代并行预测TTS 侧 MaskGCT 已验证;歌唱侧应用尚少,是潜在空白点

7.2 微调 / SFT

7.3 偏好优化与 RL(当前最活跃的方向之一)

已验证的公开工作:

歌声任务的独特机会:可验证奖励(verifiable rewards)。与开放域对话不同,歌唱有大量程序化可计算的奖励信号:
  • 唱词正确率:ASR 回转歌词 vs 输入歌词的 CER/PER(LeVo/Mureka 都用作客观指标);
  • 旋律保真度:生成 F0(RMVPE 提取)与输入乐谱的 COR/RPA/chroma 对齐(CQT/CENS 对齐正是 SVCC 分析中与主观相关性最高的客观族);
  • 节拍对齐:onset 网格偏移;音域可行性:F0 分布落在歌手音库范围内;
  • 技巧保真度:GTSinger 技巧识别器对生成结果的标签一致率。
这意味着 GRPO 类无需训练独立 RM 的算法(采样组内相对优势)天然适配歌声后训练——奖励可组合加权,但要警惕 reward hacking(如模型学会输出 ASR 友好但韵律机械的演唱;对策是多奖励正则 + KL 锚定基座)。目前尚无公开的「GRPO for singing」论文,属于明显的研究空位。

7.4 表示学习与解耦辅助任务

8 · 模型架构方案选型

8.1 声码器演进线

WaveNet(2016) → Parallel WaveGAN → HiFi-GAN(2020) → NSF-HiFiGAN(加入谐波源滤波分支,F0 作为显式条件注入,歌唱场景标配)→ BigVGAN / kNN-vocoder(泛化)→ iSTFTNet / Vocos(去掉上采样、频域逆变换头,RTF 数量级下降,实时变声首选)→ DDSP 类解析合成(最轻量,CPU 实时)。选择逻辑:离线品质看 NSF-HiFiGAN/BigVGAN,在线延迟看 Vocos/DDSP。SingGAN(ACM MM 2022)证明歌唱专用 GAN 声码器可在 2080Ti 上达 50× 实时。

8.2 条件与结构组件清单

组件主流实现经验要点
音素前端G2P + IPA;中文需处理儿化/轻声/多音字(唱词语境)跨语言合成(SynthV cross-lingual)依赖共享音素表 + 语言嵌入
F0 条件器CWT 多尺度分解 / 连续值 embedding + 换气符(unvoiced 标记)ACE Studio 文档明确区分 voiced/unvoiced pitch 曲线——工程细节直接决定咬字干净度
时长建模显式 predictor(回归 + 高斯 NLL)/ AR 内隐式编辑需求强 → 显式;整曲生成 → 内隐式 + 结构 token
风格注入全局 speaker/style embedding(FiLM)+ 局部 reference attentionTCSinger 式双模态 style encoder 是零样本 SOTA 配方
骨干网络Transformer/Conformer(AR 或非自回归);WaveNet/RoFormer 时域卷积;DiT(RoPE+qk-norm)DiTSinger 证明 SVS 也吃 scaling law;线性注意力 DiT(ACE-Step 改自 Sana)解决长序列算力
TokenizerEnCodec/DAC/自研(低帧率优先:ACE-Step latent ≈10.77Hz;LeVo Music Codec RTF 0.09)帧率 × 码率 × 重建保真的三角权衡决定 LM 系上下文长度预算
流式化因果 encoder + chunked decoder + lookahead 截断;滑窗 + SOLA 拼接(DDSP-SVC GUI)算法延迟预算:lookahead + chunk ≈ 80–300ms;StreamVC 走端侧全因果路线

8.3 三套推荐配方

A. 专业制作引擎(对标 SynthV/ACE)
   乐谱前端 → 音素/时长/F0 variance 分支 → 条件扩散或 FM mel 解码 → NSF-HiFiGAN
   + 全参数曲线编辑层(AI Pitch 初稿 + 用户覆写)
   关键指标:MOS≥4.3、逐音符可控、本地渲染 RTF<0.3

B. 开源整曲生成(对标 YuE/LeVo/ACE-Step)
   海量挖掘歌曲 → MSS 分离伪 stem → codec/LM 预训练(track-decoupled 或 DCAE+DiT-FM)
   → 指令微调 → 多维偏好后训练(DPO/GRPO + 可验证奖励)
   关键指标:PER/CER↓、人器和谐 MOS、30–60s 内出 3 分钟曲

C. 实时变声/K歌(对标 RVC realtime/seed-vc-stream)
   流式 F0(FCPE)+ 因果内容特征(ContentVec-lite)→ 小型 flow/reflow 或 iSTFT 解码
   目标延迟 ≤120ms @ 单卡消费级 GPU;DDSP 兜底 CPU 场景

9 · 评测体系与基准

9.1 客观指标

维度指标说明
音高F0 RMSE、Semitone Acc.、RPA/RCA/COR、VUV errormir_eval 实现;COR 需乐谱参照
频谱MCD(mel cepstral distortion)传统主指标,与 MOS 相关性弱,仅作 sanity check
咬字/歌词PER / CER / WER(ASR 回转)整曲生成的核心指标;LeVo PER 7.2% 最优
音色相似SECS / ECAPA / RawNet3 余弦相似度SVCC 分析:speaker embedding 与主观相似度相关性最高
旋律对齐CQT / CENS chroma alignmentSVCC2025 分析中与主观分数最相关的 dependent 指标族
分布质量FAD、MuQ/MuQ-A、Audiobox-Aesthetic(CE/CU/PQ)、PCLeVo 采用的现代组合;FAD 对小样本敏感需报告置信区间
神经 MOSUTMOS(语音迁移)、SingMOS / SingMOS-Pro(歌唱专用)SingMOS 与主观自然度相关性最高;UTMOS 跨域泛化尚可但偏乐观

9.2 主观评测

9.3 挑战赛与基准

基准内容关键结论
VCC 系列 → SVCC 2023NHSS 子集;in-domain / cross-domain SVC 两任务;26 支队伍大规模听测顶级系统自然度 ≈ GT(~3.9),但相似度无一达到目标歌手水平;cross-domain 全面更难;UTMOS 迁移可用
SVCC 2025新增 singing style 转换任务 + 专属数据集;发布 extensive analysis(arXiv 2509.15629)ARLM+Diffusion 组合最强;风格建模仍是短板;客观指标 SRCC 上限 ~0.6,主观仍是金标准;SingMOS 相关性第一
GTSinger benchmarks技巧可控 SVS / 技巧识别 / 风格迁移 / STS 四件套技巧控制领域唯一受控基准
SoulX-Singer-Eval(2026-02)零样本 SVS 评测套件:美感、信号质量、发音准确率、说话人相似、旋律精度五维配套 SoulX-Singer 模型与评测数据集开源,反映产业界开始自建 SVS eval
CtrSVDD受控歌声 deepfake 检测基准(14 种伪造系统 × 多语种真声)安全侧配套;SVC/SVS 滥用检测的起点
MIREX 歌词对齐AutoLyrixAlign 等 word-level 对齐年度评测数据管线上游质量保障

10 · 性能与训练 / 推理优化

10.1 已公开的速度基准

系统/组件速度备注
ACE-Step v1(3.5B)A100 上 4 分钟歌曲 ≈ 20s(比 LLM 基线快 15×)DCAE 低帧率 latent + 线性 DiT 少步 FM 采样
DiffRhythm≈8× 实时全曲生成latent diffusion 直出整曲
LeVo Music Codec解码 RTF 0.0902(MuCodec 0.6778 的 1/7)latent 直映音频省去中间处理
SingGAN50× 实时 @2080Ti歌唱专用 GAN 声码器
FCPE F0 提取RTF 0.0062(RMVPE 5.3×、CREPE 77× 快)实时链路的关键组件
DDSP-SVC realtime GUI消费级 GPU/CPU 可实时滑窗 + SOLA 拼接 + 上下文参考逼近离线音质
w-okada voice-changerMMVC/so-vits/DDSP/RVC 统一实时壳,GPU ~100ms 级实时 VC 生态入口

10.2 训练侧优化

10.3 推理侧优化

11 · 产品与公司版图

11.1 专业歌声制作工具(SVS 引擎)

产品 / 公司定位与技术控制能力亮点商业模式
Synthesizer V Studio 2 Pro
Dreamtonics(东京)
本地推理的 AI 歌声合成标杆;2025-02 发布 2 Pro,持续迭代(2.2.1 @2026-03);Live Rendering 实时波形预览Vocal Modes:每个音库自带多组唱法模式(如 Liam: Bright/Heavy/Rounded/Whispery/Soft/Hoarse;Mai 2: Breathy/Downer/Emotional/Powerful/Rap/Sweet)且可混合加权;动态 chest/belt/breathy 模式;AI Retakes、逐音符 pitch/timbre 编辑;跨语言合成 6 语种一次性买断 $89 + 音库分售
ACE Studio 2.0
时域科技 Timedomain(北京→LA)
云端起家(v1 需联网渲染)、2.0(2025-12)转向 all-in-one AI 音乐工作室;140+ AI 音源、8 语种;自研 Verse25 合成引擎六参数自动化(Breath/Air/Falsetto/Tension/Energy/Formant)→ 新引擎 Power/Soft/Breathy/Chest 四轴 + breath noise;Vibrato 四手柄工具;Voice Blending 音色混合;Choir Mode 和声群唱;Vocal-to-MIDI 哼唱转谱;Stem Splitter;用户上传样本训练自定义音源(voice clone)$398/$528 买断(此前订阅制 $149/年);开放 API 与数据合作(ACE-Opencpop 即其产物)
CeVIO AI / VOCALOID6 / Piapro Studio
Voisona / Yamaha / Crypton
传统歌声合成阵营:CeVIO AI 情感量参数细腻;VOCALOID6 靠 VOCALOID:AI 追赶;Crypton 以初音未来 IP + Piapro Studio NEO 生态立足参数化调教成熟但 AI 化程度落后于 SynthV/ACE买断 + IP 授权(演唱会/游戏联动是主要变现)
X Studio(小冰 × 网易云音乐,2023)平台级联合产品,面向音乐人免费的 AI 歌手创作软件(小冰框架源于 XiaoiceSing 技术线)中文虚拟歌手音源 + DAW 式工作流免费引流 + 平台内容生态

11.2 消费级整曲生成(Text-to-Song)

产品状态(截至 2026-08)人声相关亮点
Sunov5(2025-09)→ v5.5(2026 上半年);UMG 诉讼坚持 fair use 抗辩,Warner 已和解(2025-11)转为授权合作,Sony 仍在诉讼;SJ 听证排期 2026 年中评测普遍认为其人声最自然(vibrato、换气、乐句处理);4 分钟曲长、stem 导出(Premier 档)、Personas 音色复用、自定义模型训练(v5.5)
Udio2025-10-29 与 UMG 和解后关闭全部下载/stem 导出,转为流媒体围墙花园;与 UMG 共建授权平台预计 2026 上线;Sony 仍诉vocal quality 口碑好但曲长约 2 分钟;当前定位「试验沙盒」
Mureka(Mureka O1/V6)
昆仑万维
全球首批开放 API 的 AI 音乐平台;100+ 国家用户;API + 微调双开放MusiCoT 结构化推理提升段落精准度;以歌曲为 prompt、音色克隆两大特色功能;10 语种
Eleven Music
ElevenLabs
2025-08-05 发布(Kobalt/Merlin 授权背书);2026-04 独立 iOS App + Spotify 式社区/Remix;2026-05 升级为带授权 remix 模型的创作+流媒体平台(4000+ 独立艺人入驻)依托语音合成底座的人声表现力(breath/expression);4 语种人声;分段结构编辑;商业授权条款清晰是其核心卖点
Google LyriaLyria → Lyria 2 → Lyria 3(进入 Gemini 免费可用);Music AI Sandbox 面向专业音乐人;YouTube Dream Track 短视频配乐集成RealTime 模式支持交互式 DJ 式控制;企业合规路径清晰
其他MiniMax Music(国内 API 强势)、Tencent 混元/天琴方向、快手可灵音频线、Riffusion 转型、Stable Audio(器乐为主)、Beatoven/Soundraw/AIVA(BGM 向无人声)

11.3 音色克隆 / AI 翻唱 / 实时变声

11.4 中国市场版图

玩家动作
昆仑万维Mureka V1(SkyMusic 2024-04) → V6/O1(2025-03)SOTA 自称 + API 商业化;把 AI 音乐列为集团核心赛道
腾讯系TME 天琴实验室(2020 成立;虚拟人「小琴」中英粤三语演唱/口型/动作驱动;Music XR Maker 歌舞生成);全民 K 歌多维评分 + AI 歌声/戏腔翻唱;TME Studio(分离/MIR/辅助写词/智能曲谱);Tencent AI Lab LeVo 开源;曾推官方授权全 AI 歌手「AI 力宏」(与宏声文化)
网易系网易云音乐:X Studio(×小冰,免费 AI 歌手创作软件)+ 网易天音(2022-01 上线的一站式词曲编唱工具)
字节Seed-Music(豆包系能力底座);SAMI 的 Mel-RoFormer 成为全球数据管线标配;汽水音乐分发场景
阿里Tongyi CosyVoice(语音侧强,歌唱能力有限);ACE-Step 联合出品方之一 StepFun(阶跃星辰)严格说是独立公司
时域科技ACE Studio:中国唯一打入全球专业制作市场的 SVS 引擎;数据合作(ACE-Opencpop/KiSing)反哺学术
虚拟歌手 IP 经济洛天依/Vsinger(上海禾念)、星尘、五维介质系等:SynthV/DiffSinger 引擎 + 同人创作生态 + 演出变现;OpenUtau+DiffSinger 社区音源极大降低了入行门槛

11.5 版权与合规格局(产品设计硬约束)

司法域关键规则工程含义
美国Tennessee ELVIS Act(2024 生效):首个明确保护「声音形象(voice likeness)」的州法;RIAA v. Suno/Udio(2024-06 起)诉讼分裂:Suno 打 fair use、Udio 转向许可;UMG–Udio 和解(2025-10)披露模板:每次生成 $0.002–0.005 许可费 + Content ID 相似筛查 + 训练数据/日志审计权 + 覆盖未来模型版本;Warner 与 Suno/Udio 双双和解(2025-11 前后);Sony 拒绝和解继续诉讼(庭审预计 2026 下半年);Suno SJ 听证 2026-07 前后是 fair use 关键节点「训练数据审计留痕」「输出相似度指纹筛查」「按次计费的授权账本」将成为平台标配组件
中国三步走监管:《互联网信息服务深度合成管理规定》(2023-01-10 施行,声音合成属高危项需显著标识)→《生成式人工智能服务管理暂行办法》(2023-08-15)→《人工智能生成合成内容标识办法》+ 强制国标 GB 45438—2025(2025-09-01 施行):显式标识(音频开头/结尾语音提示或界面提示)+ 隐式标识(元数据五要素:AI 属性、服务者编码、内容编号、传播者编码、传播编号),禁止删除篡改标识;北京互联网法院「AI 声音第一案」(殷某案,2024-04 判决)确认自然人声音权益及于 AI 化使用导出链路必须内嵌水印/元数据写入;用户协议声明标识规范;输入端实名与音色授权校验;日志留存 ≥6 个月
欧盟AI Act Art.50 深度合成披露义务 + DSM TDM opt-out训练数据 opt-out 清单机器可读化
行业自律Kobalt/Merlin×ElevenLabs、UMG 各类授权、Grimes elf.tech 分成克隆、Holly Herndon holly+、艺术家官方 voice bank(voice-swap 等)「授权音库 + 分成」是唯一可持续的克隆商业化路径

12 · 趋势判断与机会点

① 可控性 = 符号 × 生成先验leadsheet token(可读可编辑)+ latent flow重绘/局部 inpainting,取代纯 prompt 黑盒 ② 技巧级控制是下个主战场GTSinger 受控范式 → 更大规模受控采集;技巧识别器当过滤器/奖励,闭环数据飞轮 ③ 后训练进入歌声领域多维偏好 DPO/插值(LeVo)→ GRPO +可验证奖励(唱词/F0/节拍)——公开空白 ④ 合规内化为架构约束授权音库账本、水印/元数据、相似度筛查、审计日志——从法务附件变成系统组件 ⑤ 数据工程即壁垒录音棚强标 + 挖掘多样性 + 合成自举三层金字塔;human-in-the-loop 调参流水线降本
图 3 · 2026–2028 五条确定性趋势。
结合本工作区视角的机会点:
  • RL 数据生产基础设施:歌唱后训练需要「采样 → 打分 → 偏好对构造」的高吞吐流水线,与 avalanche/agentic-rl 的 fail-to-pass 式验证思想同构——可验证奖励(唱词正确率、F0 乐谱对齐)天然适配 GRPO 批量验证。
  • 评测代理:SingMOS/SoulX-Singer-Eval/GTSinger 技巧识别器可作为 reward model 的起点;SVCC 分析给出的「客观-主观相关性表」是设计 reward 权重的直接依据。
  • Human-in-the-loop 标注工作流:ACE-Opencpop 证明「AI 初稿 + 专家修正」比纯录制便宜一个数量级,与本区 human-in-the-loop-data-workflows-study 主题直接衔接。
  • 多模态 Agent 场景:语音 Agent 若具备可控歌唱能力(情绪化应答、品牌音色 jingle、K 歌互动),将成为 moss-work 类产品的差异化能力;实时 SVC 的延迟工程是前置条件。

13 · 参考文献与链接

论文与基准

开源项目与工具链

产品与行业

附录 · 中英术语对照表

中文English一句话释义
真声/胸声modal voice / chest voice声带全振动的主声区,厚实
假声falsetto边缘振动轻飘高声区,常带气感
头声head voice高声区的明亮共鸣策略
混声mixed voice (mix)真假声肌肉配比连续混合,换声点核心技术
哨音whistle registerC6 以上极端声区
咽音pharyngeal voice咽腔收窄产生的金属芯共鸣
气声breathy voice声门不完全闭合带气流噪声的唱法
闭合/声门内收vocal fold closure / adduction声带靠拢程度——所有音色的底层连续变量
颤音vibratoF0 周期调制(幅度/频率/相位三参数)
直声straight tone无 vibrato 平直长音
滑音glissando / portamento音高连续滑动
转音/花腔melisma / riff & runs单音节跨多音符演唱
气泡音vocal fry<50Hz 不规则低频振动
怒音/嘶吼growl / distortion室带振动叠加的失真音色
强声belt高音区胸声主导高强度唱法
换声点passaggio声区间过渡区域
歌声合成Singing Voice Synthesis (SVS)乐谱 → 歌声
歌声转换Singing Voice Conversion (SVC)换音色保演唱
说转唱Speech-to-Singing (STS)说话音频 + 旋律 → 歌声
谐波噪声比HNR (Harmonics-to-Noise Ratio)气声程度的声学代理
共振峰formant声道滤波峰,决定音色/元音
导歌/主歌谱lead sheet旋律+和弦+歌词的符号化乐谱(Seed-Music token 化对象)
强制对齐forced alignment文本-音频时间戳自动标注
信失比SDR (Signal-to-Distortion Ratio)源分离质量指标(Mel-RoFormer 人声 ≈12dB)
实时因子RTF (Real-Time Factor)处理时长/音频时长,<1 即快于实时

报告完 · 生成于 2026-08-24 · 由 opencode deep research 流程产出:16 轮定向检索 + 论文/官方文档交叉核验。事实性陈述均给出处;闭源系统内部架构(Suno/Udio 等)为业界推测,已明确标注。如需补充某一维度(例如某公司深度拆解、某数据集逐字段审计),可在 research/singing-voice-study/ 下继续扩展专题。