中文

面向神经机器翻译的同形歧义消解表示学习

计算与语言 2023-04-14 v2 人工智能

摘要

同形异义词(拼写相同但意义不同的词)在神经机器翻译(NMT)中仍是难题。尽管近期工作利用多种词嵌入方法在NMT中区分词义,它们未聚焦于解决NMT中同形词歧义的关键组件:编码器的隐藏状态。本文中,我们提出一种在潜空间解决NMT同形问题的新方法。我们首先在自然语言推理(NLI)任务中训练一个编码器(又称“HDR-encoder”)以学习通用句子表示。我们进一步使用来自WordNet的基于同形词的同义词集句子微调该编码器,使其学习词级同形歧义消解表示(HDR)。预训练的HDR-encoder随后以多种方案与基于transformer的NMT集成以提升翻译精度。四个翻译方向上的实验证明了所提方法在BLEU分数上提升NMT系统性能的有效性(相较稳固基线最高+2.3)。其效果可通过额外歧义消解任务中翻译精度的其他指标(F1、精确率与召回率)验证。热力图、T-SNE与翻译示例等可视化方法也被用来展示所提方法的效果。

关键词

引用

@article{arxiv.2304.05860,
  title  = {Learning Homographic Disambiguation Representation for Neural Machine Translation},
  author = {Weixuan Wang and Wei Peng and Qun Liu},
  journal= {arXiv preprint arXiv:2304.05860},
  year   = {2023}
}