中文

利用显著文档上下文改进神经机器翻译中的词义消歧

计算与语言 2023-11-28 v1 人工智能

摘要

词汇歧义是机器翻译(MT)中一个具有挑战性且普遍存在的问题。我们引入一种简单且可扩展的方法,通过在中神经 MT 中融入少量句外上下文来解决翻译歧义。我们的方法不需要义项标注,也不需要改变标准模型架构。由于绝大多数 MT 训练数据无法获得真实文档上下文,我们为每个输入收集相关句子以构造伪文档。伪文档中的显著词随后被编码为前缀附加到每个源句上,以调节翻译的生成。为评估,我们发布了 DocMuCoW,一个基于英语-德语 MuCoW 并增补文档 ID 的翻译消歧挑战集。大量实验表明,我们的方法比强句子级基线和可比较的文档级基线更好地翻译歧义源词,同时降低了训练成本。

关键词

引用

@article{arxiv.2311.15507,
  title  = {Improving Word Sense Disambiguation in Neural Machine Translation with Salient Document Context},
  author = {Elijah Rippeth and Marine Carpuat and Kevin Duh and Matt Post},
  journal= {arXiv preprint arXiv:2311.15507},
  year   = {2023}
}