中文

PART:面向多语言语音转文本的渐进对齐表示训练(基于大语言模型)

计算与语言 2025-09-25 v1 声音

摘要

大语言模型(LLM)已从文本扩展至语音,催生了支持识别、翻译和合成的语音大模型(SLM)。一个关键挑战是对齐语音和文本表示,这在多语言设置中更为困难。现有方法通常冻结 LLM 参数并在多语言数据上训练编码器,但这迫使跨语言收敛并限制了性能。我们引入了渐进对齐表示训练(PART),一个多阶段多任务框架,将语言内对齐与跨语言对齐分离。在跨语言训练期间,LLM 参数被动态激活,并随后引入基于文本的任务以增强多语言理解。在 CommonVoice 15、Fleurs、Wenetspeech 和 CoVoST2 上的实验表明,PART 超越了传统方法,分析证实其能够平衡语言特定差异与跨语言泛化。这些结果展示了 PART 在多语言语音模态对齐方面的有效性和通用性。

关键词

引用

@article{arxiv.2509.19745,
  title  = {PART: Progressive Alignment Representation Training for Multilingual Speech-To-Text with LLMs},
  author = {Pei Zhang and Andong Chen and Xi Chen and Baosong Yang and Derek F. Wong and Fei Huang},
  journal= {arXiv preprint arXiv:2509.19745},
  year   = {2025}
}