中文

基于 LLM 的语音翻译自适应内部语音-文本对齐方法

计算与语言 2025-03-14 v1 声音 音频与语音处理

摘要

大语言模型(LLM)的近期发展推动了跨多个任务的重大突破,为 LLM 基于语音翻译系统的发展奠定了基础。现有方法主要关注跨模态输入输出的对齐,忽略了模型表示内部更深层次的语义对齐。为此,我们提出一种 Adaptive Inner Speech-Text Alignment(AI-STA)方法,通过显式对齐 LLM 中选定层的语音和文本表示来弥合模态鸿沟。为实现这一目标,我们利用最优传输(OT)理论量化语音和文本之间的细粒度表示差异。此外,我们利用跨模态检索技术识别最适合对齐的层,并对这些层进行联合训练。基于语音翻译(ST)任务的实验结果表明,AI-STA 显著性地提高了大型语音-文本模型(LSM)的翻译性能,超越了以前的状态方法。我们的发现凸显了 LLM 中内部层语音-文本对齐的重要性,并为增强跨模态学习提供了新见解。

关键词

引用

@article{arxiv.2503.10211,
  title  = {Adaptive Inner Speech-Text Alignment for LLM-based Speech Translation},
  author = {Henglyu Liu and Andong Chen and Kehai Chen and Xuefeng Bai and Meizhi Zhong and Yuan Qiu and Min Zhang},
  journal= {arXiv preprint arXiv:2503.10211},
  year   = {2025}
}

备注

12 pages, 7 figures