InstructAudio:基于自然语言指令的统一语音与音乐生成
音频与语音处理
2025-11-25 v1 人工智能
计算与语言
声音
摘要
文本语音合成 (TTS) 和文本音乐生成 (TTM) 模型在指令式控制方面面临显著局限。TTS 系统通常依赖参考音频获取语音风格,仅能实现有限的文本级属性控制,且很少支持对话生成。TTM 系统受限于输入条件要求,需依赖专家知识标注。这些输入控制条件的高度异构性使其难以进行语音合成的联合建模。尽管这两类任务在声学建模方面存在共性,却长期独立发展,留下了通过自然语言指令实现统一建模的挑战。我们引入 InstructAudio,一个统一框架,实现对声学属性的指令式控制,包括语音风格(性别、年龄)、段话层面特征(情感、风格、方言)以及音乐特征(流派、乐器、节奏、氛围)。其支持英语和中文的表达语音、音乐及对话生成。该模型采用联合与单一扩散变换器层,采用标准化的指令-音素输入格式,在 50K 小时语音和 20K 小时音乐数据上训练,实现多任务学习和跨模态对齐。图 1 显示了与主流 TTS 和 TTM 模型的性能比较,表明 InstructAudio 在大多数指标上实现最佳效果。据我们所知,InstructAudio 是首个实现语音与音乐生成统一指令控制的框架。音频样本可在 https://qiangchunyu.github.io/InstructAudio/ 查阅。
引用
@article{arxiv.2511.18487,
title = {InstructAudio: Unified speech and music generation with natural language instruction},
author = {Chunyu Qiang and Kang Yin and Xiaopeng Wang and Yuzhe Liang and Jiahui Zhao and Ruibo Fu and Tianrui Wang and Cheng Gong and Chen Zhang and Longbiao Wang and Jianwu Dang},
journal= {arXiv preprint arXiv:2511.18487},
year = {2025}
}