中文

Ti-Audio:面向藏语的首个多方言端到端语音大语言模型

声音 2026-04-29 v2

摘要

近期语音大语言模型(Speech-LLM)取得了显著进展,大幅提升了多模态交互能力。然而,其在资源匮乏且方言多样的环境中仍面临挑战。藏语数据严重稀缺,同时其主要方言(\"U-Tsang、Amdo、Kham)之间存在语音差异,正是这一挑战的典型例子。本文提出 Ti-Audio,藏语首个多方言端到端语音大语言模型。为高效对齐语音与文本,我们引入了动态 Q-Former 适配器,从变长语音中提取关键声学特征,确保即使在数据有限的情况下也能实现稳定的跨模态对齐。在数据层面,我们利用相关方言之间的相互协作以缓解数据稀缺问题,并采用温度采样策略以最大化这种协同效应。实验结果显示,Ti-Audio 在藏语基准任务上的自动语音识别和语音翻译均实现了最先进的性能。我们的工作验证了跨方言协作的有效性,为在资源匮乏场景下开发 Speech-LLM 提供了可扩展的范式。

关键词

引用

@article{arxiv.2604.11110,
  title  = {Ti-Audio: The First Multi-Dialectal End-to-End Speech LLM for Tibetan},
  author = {Jialing Wang and Yue Zhao and Yuhao Zhang and Jing Yu and Shaosai Li and Zhanchen Dai and Benyou Wang and Haizhou Li},
  journal= {arXiv preprint arXiv:2604.11110},
  year   = {2026}
}