UniSonate:面向文本指令的语音、音乐与音效统一生成模型
音频与语音处理
2026-04-27 v1 人工智能
计算与语言
声音
摘要
生成式音频建模在很大程度上被分割为各自专业的任务,即文本到语音(TTS)、文本到音乐(TTM)和文本到音频(TTA),每个任务都在异构的控制范式下运行。将这些模态统一仍是一个根本性的挑战,因为结构化的语义表示(语音/音乐)与非结构化声学纹理(音效)之间固有的不一致。本文介绍了UniSonate,一个统一的流匹配框架,能够通过标准化的、无参考的自然语言指令接口来合成语音、音乐和音效。为解决结构性差异,我们提出了一种新颖的动态token注入机制,将非结构化环境声投射到结构化的时间潜在空间中,从而在基于phoneme驱动的多模态扩散Transformer(MM-DiT)中实现精确的时长控制。结合多阶段课程学习策略,该方法有效缓解了跨模态优化冲突。广泛的实验表明,UniSonate在基于指令的TTS(WER 1.47%)和TTM(SongEval Coherence 3.18)方面实现了最先进的性能,同时在TTA方面保持了具竞争力的保真度。关键的是,我们观察到联合训练在多样化音频数据上会显著增强结构连贯性和韵律表达力,优于单任务基线。音频样本可在 https://qiangchunyu.github.io/UniSonate/ 查看。
引用
@article{arxiv.2604.22209,
title = {UniSonate: A Unified Model for Speech, Music, and Sound Effect Generation with Text Instructions},
author = {Chunyu Qiang and Xiaopeng Wang and Kang Yin and Yuzhe Liang and Yuxin Guo and Teng Ma and Ziyu Zhang and Tianrui Wang and Cheng Gong and Yushen Chen and Ruibo Fu and Chen Zhang and Longbiao Wang and Jianwu Dang},
journal= {arXiv preprint arXiv:2604.22209},
year = {2026}
}
备注
Accepted to ACL 2026 main conference (oral)