定位-聚焦:提升语音语言模型中术语翻译的效果
计算与语言
2025-07-25 v1 人工智能
摘要
直接语音翻译(ST)近年来受到广泛关注,但对话中术语的准确翻译仍然是巨大挑战。目前的研究主要致力于将各种翻译知识引入ST模型,但这些方法常受无关噪声干扰,无法充分利用翻译知识。为此,本文提出一种新颖的术语翻译方法——定位-聚焦(Locate-and-Focus)。该方法首先有效定位包含术语的语音片段,以构建翻译知识,从而最小化ST模型所需的无关信息。随后,它将翻译知识与来自音频和文本两种模态的输入及假设结果进行关联,使ST模型在翻译过程中能够更好地聚焦于翻译知识。实验结果表明,在多种数据集上,本方法有效地定位了语音中的术语,显著提升了术语翻译的成功率,同时保持了稳健的整体翻译性能。
引用
@article{arxiv.2507.18263,
title = {Locate-and-Focus: Enhancing Terminology Translation in Speech Language Models},
author = {Suhang Wu and Jialong Tang and Chengyi Yang and Pei Zhang and Baosong Yang and Junhui Li and Junfeng Yao and Min Zhang and Jinsong Su},
journal= {arXiv preprint arXiv:2507.18263},
year = {2025}
}
备注
Accepted at ACL 2025