分析神经机器翻译中源端与目标端对预测的贡献
计算与语言
2021-06-28 v3
摘要
在神经机器翻译(更一般地,条件语言建模)中,目标词元的生成受两类上下文影响:源序列和目标序列前缀。尽管已有许多尝试理解 NMT 模型的内部机制,但无一明确评估源端与目标端对生成决策的相对贡献。我们认为,这一相对贡献可通过采用层间相关性传播(LRP)的一种变体来评估。其底层的“守恒原理”使相关性传播独具特色:与其他方法不同,它评估的不是反映词元重要性的抽象量,而是每个词元影响的比例。我们将 LRP 扩展至 Transformer,并对 NMT 模型进行分析,明确评估源端与目标端对生成过程的相对贡献。我们分析了在不同类型前缀条件下、改变训练目标或训练数据量时、以及训练过程中这些贡献的变化。我们发现,用更多数据训练的模型往往更依赖源信息,且词元贡献更为尖锐;训练过程是非单调的,包含若干不同性质的阶段。
引用
@article{arxiv.2010.10907,
title = {Analyzing the Source and Target Contributions to Predictions in Neural Machine Translation},
author = {Elena Voita and Rico Sennrich and Ivan Titov},
journal= {arXiv preprint arXiv:2010.10907},
year = {2021}
}
备注
ACL 2021 (more accurate results with the improved LRP code)