中文

TTA:面向跨语言语音表示的 Transcribe、Translate 与 Alignment

音频与语音处理 2026-02-11 v2

摘要

语音-LLM 模型在多模态和多任务语音理解方面显示出卓越的性能。典型的语音-LLM 范例是将语音模态与大型语言模型(LLM)集成。虽然 Whisper 编码器经常被用于语音输入,但其在输入格式、模型规模和语义性能方面存在局限。为此,我们提出一种轻量级 TTA 模型,专为语音语义优化,以实现更有效的 LLM 集成。在 ASV、语音翻译和语音-文本对齐等大规模语音识别训练任务中进行 35.8 万小时的大规模训练后,TTA 能够产生稳健的跨语言语音表示。在包括语音检索和 ASV-LLM 性能评估等多样化基准测试上的广泛评估表明,TTA 在 Whisper 方面具有优势。进一步,我们严格验证了跨语言能力与 ASV/ST 性能之间的相互作用。TTA 的模型权重和训练配方将作为音频理解工具包 Auden 的一部分发布。

关键词

引用

@article{arxiv.2511.14410,
  title  = {TTA: Transcribe, Translate and Alignment for Cross-lingual Speech Representation},
  author = {Wei Liu and Jiahong Li and Yiwen Shao and Dong Yu},
  journal= {arXiv preprint arXiv:2511.14410},
  year   = {2026}
}

备注

Accepted by ICASSP2026