端到端神经词对齐超越 GIZA++
计算与语言
2020-05-01 v1
摘要
词对齐曾因在训练统计机器翻译(MT)模型中的关键作用而是自然语言处理中一项核心的无监督学习任务。尽管训练神经 MT 模型不再需要词对齐,词对齐仍在神经机器翻译的交互式应用中发挥重要作用,如标注迁移与词典注入。虽然统计 MT 方法已被性能更优的神经方法取代,但有二十年历史的 GIZA++ 工具包仍是最先进词对齐系统的关键组件。先前关于神经词对齐的工作仅能在训练期间使用其输出时超越 GIZA++。我们提出首个端到端神经词对齐方法,在三个数据集上稳定优于 GIZA++。我们的方法将训练用于监督翻译的 Transformer 模型重新用作无监督词对齐模型,方式紧密集成且不影响翻译质量。
引用
@article{arxiv.2004.14675,
title = {End-to-End Neural Word Alignment Outperforms GIZA++},
author = {Thomas Zenkel and Joern Wuebker and John DeNero},
journal= {arXiv preprint arXiv:2004.14675},
year = {2020}
}
备注
Accepted at ACL 2020