中文

源语法的编码:跨目标语言的 NMT 表示中的相似性

计算与语言 2020-05-19 v1 机器学习

摘要

我们训练了从英语到六种目标语言的神经机器翻译(NMT)模型,利用 NMT 编码器表示来预测源语言词的祖先成分标签。我们发现,无论 NMT 目标语言为何,NMT 编码器都学习到相似的源语语法,并依赖显式的形态句法线索从源句中提取句法特征。此外,NMT 编码器在若干成分标签预测任务上优于直接训练的 RNN,表明 NMT 编码器表示可有效用于涉及句法的自然语言任务。然而,NMT 编码器和直接训练的 RNN 所学到的句法信息均与概率上下文无关文法(PCFG)解析器有实质性不同。尽管总体准确率得分较低,PCFG 常在 RNN 类模型表现不佳的句子上表现良好,表明 RNN 架构在其可学句法类型上受到限制。

关键词

引用

@article{arxiv.2005.08177,
  title  = {Encodings of Source Syntax: Similarities in NMT Representations Across Target Languages},
  author = {Tyler A. Chang and Anna N. Rafferty},
  journal= {arXiv preprint arXiv:2005.08177},
  year   = {2020}
}

备注

To appear at the 5th Workshop on Representation Learning for NLP