大型音频语言模型的直接同声传译激活
声音
2026-05-06 v2 计算与语言
音频与语音处理
摘要
同声语音到文本翻译(Simul-S2TT)旨在实时将语音翻译为目标文本,在接收源语音输入的同时输出翻译,而不是等待整个话语说完。Simul-S2TT 研究通常修改模型架构以实现读写策略。然而,随着大型音频语言模型(LALMs)的兴起,一个关键挑战是如何在不进行额外架构更改的情况下直接激活基础模型中的 Simul-S2TT 能力。在本文中,我们引入了同声自增强(SimulSA),这是一种利用 LALMs 固有能力通过随机截断语音并构建部分对齐翻译来获取同声数据的策略。通过将它们纳入离线 SFT 数据,SimulSA 有效地弥合了预训练期间的离线翻译与推理期间的同声翻译之间的分布差距。实验结果表明,与完整的离线 SFT 数据相比,仅增强约 1% 的同声数据,即可在不修改模型架构或解码策略的情况下显著激活 LALMs 的 Simul-S2TT 能力。
引用
@article{arxiv.2509.15692,
title = {Direct Simultaneous Translation Activation for Large Audio-Language Models},
author = {Pei Zhang and Yiming Wang and Jialong Tang and Baosong Yang and Rui Wang and Derek F. Wong and Fei Huang},
journal= {arXiv preprint arXiv:2509.15692},
year = {2026}
}
备注
Accepted by ICASSP 2026