中文

面向同声机器翻译的前瞻未来策略

计算与语言 2024-05-29 v1 人工智能

摘要

同声机器翻译(SiMT)在读取源句的同时输出译文。与传统的序列到序列(seq2seq)训练不同,现有 SiMT 方法采用前缀到前缀(prefix2prefix)训练,即模型基于部分源 token 预测目标 token。然而,prefix2prefix 训练削弱了模型捕捉全局信息的能力,并因缺乏必要的源信息而引入了强制预测。因此,弥合 prefix2prefix 训练与 seq2seq 训练之间的差距以增强 SiMT 模型的翻译能力至关重要。本文提出一种新颖方法,在课程学习中前瞻未来,以实现从 seq2seq 训练到 prefix2prefix 训练的过渡。具体而言,我们逐步将可用源信息从整个句子减少到与该延迟相对应的前缀。我们的方法适用于多种 SiMT 方法,实验表明该方法优于强基线。

关键词

引用

@article{arxiv.2309.06179,
  title  = {Glancing Future for Simultaneous Machine Translation},
  author = {Shoutao Guo and Shaolei Zhang and Yang Feng},
  journal= {arXiv preprint arXiv:2309.06179},
  year   = {2024}
}

备注

5 pages, 4 figure, Submitted to ICASSP 2024