源语法的编码:跨目标语言的 NMT 表示中的相似性
计算与语言
2020-05-19 v1 机器学习
摘要
我们训练了从英语到六种目标语言的神经机器翻译(NMT)模型,利用 NMT 编码器表示来预测源语言词的祖先成分标签。我们发现,无论 NMT 目标语言为何,NMT 编码器都学习到相似的源语语法,并依赖显式的形态句法线索从源句中提取句法特征。此外,NMT 编码器在若干成分标签预测任务上优于直接训练的 RNN,表明 NMT 编码器表示可有效用于涉及句法的自然语言任务。然而,NMT 编码器和直接训练的 RNN 所学到的句法信息均与概率上下文无关文法(PCFG)解析器有实质性不同。尽管总体准确率得分较低,PCFG 常在 RNN 类模型表现不佳的句子上表现良好,表明 RNN 架构在其可学句法类型上受到限制。
引用
@article{arxiv.2005.08177,
title = {Encodings of Source Syntax: Similarities in NMT Representations Across Target Languages},
author = {Tyler A. Chang and Anna N. Rafferty},
journal= {arXiv preprint arXiv:2005.08177},
year = {2020}
}
备注
To appear at the 5th Workshop on Representation Learning for NLP