中文

论神经机器翻译模型的 linguistic 表征能力

计算与语言 2019-11-04 v1

摘要

尽管深度神经网络在自然语言处理(NLP)中近期取得成功,其可解释性仍是一项挑战。我们分析神经机器翻译模型在不同粒度上学习到的表征,并通过相关的外在属性评估其质量。具体而言,我们寻求以下问题的答案:(i)词结构在学习到的表征中被捕捉的准确程度如何,这是在翻译形态丰富语言时的重要方面?(ii)这些表征是否捕捉长距离依赖,并有效处理句法差异大的语言?(iii)这些表征是否捕捉词汇语义?我们沿若干参数展开深入调研:(i)架构中的哪些层捕捉这些语言现象;(ii)翻译单元的选择(词、字符或子词单元)如何影响底层表征所捕捉的语言属性;(iii)编码器和解码器是否以不同且独立的方式学习?(iv)多语 NMT 模型学习到的表征是否与其双语对应模型捕捉相同量的语言信息?我们数据驱动、定量的评估阐明了 NMT 模型的重要方面及其捕捉各种语言现象的能力。我们表明深度 NMT 模型学习到非平凡量的语言信息。值得注意的发现包括:i)词形态和词性信息在模型的较低层被捕捉;(ii)相反,词汇语义或非局部句法与语义依赖在较高层表征得更好;(iii)使用字符学习的表征比使用子词单元学习的表征更了解词形态;以及(iv)多语模型学习的表征比双语模型更丰富。

关键词

引用

@article{arxiv.1911.00317,
  title  = {On the Linguistic Representational Power of Neural Machine Translation Models},
  author = {Yonatan Belinkov and Nadir Durrani and Fahim Dalvi and Hassan Sajjad and James Glass},
  journal= {arXiv preprint arXiv:1911.00317},
  year   = {2019}
}

备注

Accepted to appear in the Journal of Computational Linguistics