中文

AlignAtt:利用基于注意力的音频-翻译对齐作为同步语音翻译的引导

计算与语言 2026-02-04 v3 机器学习 声音 音频与语音处理

摘要

注意力是当今自然语言处理最常用架构的核心机制,并已从多个视角被分析,包括其对机器翻译相关任务的有效性。在这些研究中,即便输入文本被音频段替代(如语音翻译(ST)任务的情形),注意力也被证明是获取词对齐洞察的有用信息来源。本文中,我们提出 AlignAtt,一种用于同步 ST(SimulST)的新策略,其利用注意力信息生成源-目标对齐来在推理时引导模型。通过在 MuST-C v1.0 的 8 个语言对上的实验,我们表明 AlignAtt 优于应用于离线训练模型的先前最先进 SimulST 策略,在 BLEU 上取得 2 分的提升,并在 8 种语言上实现 0.5s 至 0.8s 的延迟降低。

关键词

引用

@article{arxiv.2305.11408,
  title  = {AlignAtt: Using Attention-based Audio-Translation Alignments as a Guide for Simultaneous Speech Translation},
  author = {Sara Papi and Marco Turchi and Matteo Negri},
  journal= {arXiv preprint arXiv:2305.11408},
  year   = {2026}
}