中文

DualSpeechLM:通过大型语言模型的双重语音标记建模实现统一的语音理解与生成

声音 2025-11-18 v3 音频与语音处理

摘要

通过引入各种有效的语音标记来扩展预训练文本大型语言模型(LLM)的语音理解或生成能力,在语音社区引起了极大关注。然而,构建统一的语音理解与生成模型仍面临以下挑战:(1)由于语音和文本标记之间存在巨大的模态差距,将文本 LLM 扩展到统一的语音 LLM 依赖于大规模配对数据进行微调;(2)生成和理解任务偏好不同层级的信息,例如,生成受益于详细的声学特征,而理解则偏好高级语义。这种差异导致在单一统一模型中难以进行性能优化。为了解决这些挑战,本文提出了语音标记化和语音语言建模方面的两个关键见解。具体来说,我们首先提出了一种理解驱动的语音标记器(USTokenizer),它提取完成理解任务所必需的高级语义信息,以便使用文本 LLM。通过这种方式,USToken 与文本具有更好的模态共性,从而降低了将文本 LLM 适配到语音 LLM 时的模态对齐难度。其次,我们提出了 DualSpeechLM,这是一个双标记建模框架,它在统一的端到端框架内同时将 USToken 作为输入建模,并将声学标记作为输出建模,无缝集成了语音理解与生成能力。此外,我们提出了一种新颖的语义监督损失和条件链(CoC)策略,以稳定模型训练并增强语音生成性能。实验结果表明,我们提出的方法有效地促进了理解与生成任务之间的互补关系,突显了在单一统一模型中相互增强这两项任务的潜力。

关键词

引用

@article{arxiv.2508.08961,
  title  = {DualSpeechLM: Towards Unified Speech Understanding and Generation via Dual Speech Token Modeling with Large Language Models},
  author = {Yuanyuan Wang and Dongchao Yang and Yiwen Shao and Hangting Chen and Jiankun Zhao and Zhiyong Wu and Helen Meng and Xixin Wu},
  journal= {arXiv preprint arXiv:2508.08961},
  year   = {2025}
}

备注

Accepted by AAAI 2026