中文

TASU:面向语音理解的文本-only 对齐

音频与语音处理 2026-01-27 v2

摘要

语音大语言模型(Speech LLMs)的最新进展为跨越多样化语音理解任务的统一架构铺平了道路。然而,现有的对齐范式高度依赖大规模音频-文本配对数据和计算密集型训练,却常常在面对未知领域或任务时表现有限。为此,我们提出 TASU(Text-only Alignment for Speech Understanding),一种新型对齐范式,可仅利用未配对的文本数据引导跨模态对齐。实验表明,TASU 能够实现具竞争力的零样语音识别效果。借助这一属性,它可进一步作为课程学习的预训练阶段,以增强语音识别中的领域泛化能力。最终,TASU 可将其零样泛化扩展到广泛的语音理解任务,并在 MMSU 基准测试中显著优于包括 GLM-4-Voice 和 Step-Audio 在内的多数语音 LLM,确立了 TASU 作为语音 LLMs 高效且可扩展对齐范式的地位。

关键词

引用

@article{arxiv.2511.03310,
  title  = {TASU: Text-Only Alignment for Speech Understanding},
  author = {Jing Peng and Yi Yang and Xu Li and Yu Xi and Quanwei Tang and Yangui Fang and Junjie Li and Kai Yu},
  journal= {arXiv preprint arXiv:2511.03310},
  year   = {2026}
}

备注

Accepted to ICASSP 2026