基于 LLM 的语音翻译自适应内部语音-文本对齐方法
计算与语言
2025-03-14 v1 声音
音频与语音处理
摘要
大语言模型(LLM)的近期发展推动了跨多个任务的重大突破,为 LLM 基于语音翻译系统的发展奠定了基础。现有方法主要关注跨模态输入输出的对齐,忽略了模型表示内部更深层次的语义对齐。为此,我们提出一种 Adaptive Inner Speech-Text Alignment(AI-STA)方法,通过显式对齐 LLM 中选定层的语音和文本表示来弥合模态鸿沟。为实现这一目标,我们利用最优传输(OT)理论量化语音和文本之间的细粒度表示差异。此外,我们利用跨模态检索技术识别最适合对齐的层,并对这些层进行联合训练。基于语音翻译(ST)任务的实验结果表明,AI-STA 显著性地提高了大型语音-文本模型(LSM)的翻译性能,超越了以前的状态方法。我们的发现凸显了 LLM 中内部层语音-文本对齐的重要性,并为增强跨模态学习提供了新见解。
引用
@article{arxiv.2503.10211,
title = {Adaptive Inner Speech-Text Alignment for LLM-based Speech Translation},
author = {Henglyu Liu and Andong Chen and Kehai Chen and Xuefeng Bai and Meizhi Zhong and Yuan Qiu and Min Zhang},
journal= {arXiv preprint arXiv:2503.10211},
year = {2025}
}
备注
12 pages, 7 figures