基于神经机器翻译的跨语言文档嵌入
计算与语言
2020-08-20 v3
摘要
本文研究了一种跨语言文档嵌入方法,该方法改进了当前基于神经机器翻译框架的文档向量(NTDV 或简称 NV)。NV 是在神经机器翻译(NMT)框架下借助自注意力机制开发的。在 NV 中,不同语言中的每对平行文档都被投影到模型中的同一共享层。然而,NV 嵌入对之间并不能保证相似。本文进一步在 NV 的训练目标函数中加入距离约束,使得平行文档的两个嵌入尽可能接近。这一新方法将被称为约束 NV(cNV)。在跨语言文档分类任务中,新的 cNV 表现与 NV 相当,并优于其他已发表且需要前向传播解码的研究。与先前的 NV 相比,cNV 在测试时不需要翻译器,因此该方法更轻量且更灵活。
引用
@article{arxiv.1807.11057,
title = {NMT-based Cross-lingual Document Embeddings},
author = {Wei Li and Brian Mak},
journal= {arXiv preprint arXiv:1807.11057},
year = {2020}
}