中文

基于语言模型的文本到音频生成:反因果对齐的协同残差变换器

声音 2025-10-07 v1 机器学习 多媒体 音频与语音处理

摘要

虽然语言模型 (LMs) 与残差向量量化 (RVQ) 标记化器配合在文本到音频 (T2A) 生成中显示出前景,但仍落后于扩散模型。我们识别了这一差距背后的关键困境:增加更多 RVQ 层可提高音频重构保真度,但超出了常规语言模型的生成能力。为此,我们首先分析了 RVQ 动力学,发现两个关键局限性:1) 跨 RVQ 层特征的正交性阻碍了有效的 LM 训练;2) 来自更深层 RVQ 标记的语义丰富度下降加剧了自回归解码中的暴露偏差。在这些见解基础上,我们提出了 Siren,一种新型 LM 为基础的框架,采用多个孤立变换器,结合因果条件和反因果对齐。广泛的实验表明,Siren 在现有 LM 为基础和扩散模型为基础的 T2A 系统中均取得了最先进的结果。通过桥接 LM 的表征优势与音频合成的保真度需求,我们的方法将 LM 重新定位为 T2A 任务中对抗扩散模型的有力竞争者。此外,通过将音频表征与语言结构对齐,Siren 为通往统一多模态生成框架的道路提供了可行性。

关键词

引用

@article{arxiv.2510.04577,
  title  = {Language Model Based Text-to-Audio Generation: Anti-Causally Aligned Collaborative Residual Transformers},
  author = {Juncheng Wang and Chao Xu and Cheng Yu and Zhe Hu and Haoyu Xie and Guoqi Yu and Lei Shang and Shujun Wang},
  journal= {arXiv preprint arXiv:2510.04577},
  year   = {2025}
}

备注

Accepted to EMNLP 2025