利用查询项音译提升英印跨语言信息检索的性能
信息检索
2014-01-16 v1 计算与语言
摘要
跨语言信息检索(CLIR)的主要问题在于,与单语言检索性能相比,其平均精度较差。导致 CLIR 性能不佳的主要原因是查询项不匹配、词汇歧义以及查询项未翻译。为了提高 CLIR 系统的性能,需要解决 CLIR 现有的问题。在本文中,我们通过提出一种改进英印 CLIR 系统性能的算法,致力于解决该问题。我们利用英文查询项的音译,生成了印地语翻译查询的所有可能组合,并从中选择最佳查询进行文档检索。实验在 FIRE 2010(信息检索评估论坛)数据集上进行。实验结果表明,所提出的方法赋予了英印 CLIR 系统更好的性能,同时有助于克服现有问题,并在平均精度上优于现有的英印 CLIR 系统。
引用
@article{arxiv.1401.3510,
title = {Improving Performance Of English-Hindi Cross Language Information Retrieval Using Transliteration Of Query Terms},
author = {Saurabh Varshney and Jyoti Bajpai},
journal= {arXiv preprint arXiv:1401.3510},
year = {2014}
}
备注
International Journal on Natural Language Computing (IJNLC) Vol. 2, No.6, December 2013 http://airccse.org/journal/ijnlc/index.html