NMT 衍生跨语言嵌入的实证分析及其在平行句识别中的应用
计算与语言
2017-11-16 v2
摘要
端到端的神经机器翻译(NMT)在某些语言对(尤其是那些拥有大量平行数据的语言对)的翻译质量上已经超越了统计机器翻译。除了这一显著改进外,神经网络还提供了若干新特性。可以训练单一系统以几乎除训练时间外无额外代价的方式在多种语言间进行翻译。此外,网络学习到的内部表示充当了词或句子的一种新的语义表示,与标准词嵌入不同,它们本质上是在双语甚至多语语境中学习的。鉴于这些特性,本工作的贡献有两方面。首先,我们系统地研究了 NMT 上下文向量(即编码器的输出)及其作为句子跨语言表示的能力。我们通过测量跨翻译的相似性以及语义相关和语义不相关的句子对来评估其质量和有效性。其次,作为对第一点的外部评价,我们在可比语料中识别平行句,仅使用 NMT 上下文向量时在共享任务数据上获得了 F1=98.2%。将上下文向量与相似性度量联合使用时,F1 达到 98.9%。
引用
@article{arxiv.1704.05415,
title = {An Empirical Analysis of NMT-Derived Interlingual Embeddings and their Use in Parallel Sentence Identification},
author = {Cristina España-Bonet and Ádám Csaba Varga and Alberto Barrón-Cedeño and Josef van Genabith},
journal= {arXiv preprint arXiv:1704.05415},
year = {2017}
}
备注
11 pages, 4 figures