BilBOWA:无需词对齐的快速双语分布式表示
机器学习
2016-02-05 v3 计算与语言
机器学习
摘要
我们介绍了 BilBOWA(Bilingual Bag-of-Words without Alignments,无对齐双语词袋模型),这是一种简单且计算高效的双语词分布式表示学习模型,可扩展至大规模单语数据集,且无需词对齐的平行训练数据。该模型直接在单语数据上进行训练,并从较小规模的原始文本句子对齐数据中提取双语信号。这是通过一种新颖的采样词袋跨语言目标函数实现的,该目标函数用于正则化两个噪声对比语言模型,以实现高效的跨语言特征学习。我们表明,使用该模型学习到的双语嵌入在跨语言文档分类任务以及 WMT11 数据上的词汇翻译任务中,均优于最先进 (SOTA) 的方法。
引用
@article{arxiv.1410.2455,
title = {BilBOWA: Fast Bilingual Distributed Representations without Word Alignments},
author = {Stephan Gouws and Yoshua Bengio and Greg Corrado},
journal= {arXiv preprint arXiv:1410.2455},
year = {2016}
}