使用词嵌入进行印地语到英语跨语言信息检索的查询翻译
计算与语言
2016-08-05 v1
摘要
跨语言信息检索(CLIR)近年来因网络上多语言内容的增长已成为一个重要的待解决问题。标准方法之一是使用从源语言到目标语言的查询翻译。本文中,我们提出一种基于词嵌入的方法,该方法捕捉源语言中特定词的上下文线索,并给出那些在目标语言中出现在相似上下文的词作为翻译。一旦获得源语言与目标语言对的词嵌入,我们利用带有词翻译对的词典学习从源词嵌入到目标词嵌入的投影。随后我们提出多种查询翻译与聚合方法。该方法的优势在于不需要语料库对齐(这对于资源稀缺语言难以获取),带有词翻译对的词典就足以训练用于翻译的词向量。我们使用信息检索与评价论坛(FIRE)2008和2012数据集进行印地语到英语的CLIR实验。所提出的基于词嵌入的方法比基本的基于词典的方法高出70%,而当词嵌入与词典结合时,混合方法比基线基于词典的方法高出77%。当与从Google Translate和词典获得的翻译结合时,它比英语单语基线高出15%。
引用
@article{arxiv.1608.01561,
title = {UsingWord Embeddings for Query Translation for Hindi to English Cross Language Information Retrieval},
author = {Paheli Bhattacharya and Pawan Goyal and Sudeshna Sarkar},
journal= {arXiv preprint arXiv:1608.01561},
year = {2016}
}
备注
17th International Conference on Intelligent Text Processing and Computational Linguistics