中文

通过长度感知框架降低同声机器翻译中的位置偏置

计算与语言 2022-03-24 v2 人工智能

摘要

同声机器翻译(SiMT)在接收流式源输入的同时开始翻译,因此源句在翻译过程中总是不完整的。与使用常规 seq-to-seq 架构的全句 MT 不同,SiMT 常采用前缀到前缀架构,迫使每个目标词仅与部分源前缀对齐,以适应流式输入中的不完整源。然而,靠前位置的源词因出现在更多前缀中而被虚幻地认为更重要,导致位置偏置,使模型在测试时更关注靠前源位置。本文首先分析了 SiMT 中的位置偏置现象,并提出了一种长度感知框架,通过弥合 SiMT 与全句 MT 间的结构差距来降低位置偏置。具体而言,给定流式输入,我们先预测全句长度,然后用位置编码填充未来源位置,从而将流式输入转化为伪全句。所提框架可集成到大多数现有 SiMT 方法中以进一步提升性能。在两种代表性 SiMT 方法(包括最优自适应策略)上的实验表明,我们的方法成功降低了位置偏置,从而取得了更好的 SiMT 性能。

关键词

引用

@article{arxiv.2203.09053,
  title  = {Reducing Position Bias in Simultaneous Machine Translation with Length-Aware Framework},
  author = {Shaolei Zhang and Yang Feng},
  journal= {arXiv preprint arXiv:2203.09053},
  year   = {2022}
}

备注

Accept to ACL 2022 main conference. 14 pages, 11 figures