中文

在词性与语义标注任务上评估神经机器翻译中的表示层

计算与语言 2018-01-25 v1

摘要

虽然神经机器翻译(NMT)模型在优雅的端到端框架中提供了改进的翻译质量,但它们学到了什么语言知识尚不清晰。近期工作已开始评估 NMT 模型在形态和句法任务上学习到的向量表示的质量。在本文中,我们研究 NMT 编码器不同层学到的表示。我们在平行数据上训练 NMT 系统,并使用训练好的模型提取特征以在两个任务上训练分类器:词性标注和语义标注。然后我们将分类器的性能作为给定任务下原始 NMT 模型质量的代理来进行度量。我们的定量分析产生了关于 NMT 模型中表示学习的有趣见解。例如,我们发现较高层更擅长学习语义,而较低层往往更擅长词性标注。我们还观察到目标语言对源端表示影响很小,尤其是在质量更高的 NMT 模型中。

关键词

引用

@article{arxiv.1801.07772,
  title  = {Evaluating Layers of Representation in Neural Machine Translation on Part-of-Speech and Semantic Tagging Tasks},
  author = {Yonatan Belinkov and Lluís Màrquez and Hassan Sajjad and Nadir Durrani and Fahim Dalvi and James Glass},
  journal= {arXiv preprint arXiv:1801.07772},
  year   = {2018}
}

备注

IJCNLP 2017