中文

利用查询项音译提升英印跨语言信息检索的性能

信息检索 2014-01-16 v1 计算与语言

摘要

跨语言信息检索(CLIR)的主要问题在于,与单语言检索性能相比,其平均精度较差。导致 CLIR 性能不佳的主要原因是查询项不匹配、词汇歧义以及查询项未翻译。为了提高 CLIR 系统的性能,需要解决 CLIR 现有的问题。在本文中,我们通过提出一种改进英印 CLIR 系统性能的算法,致力于解决该问题。我们利用英文查询项的音译,生成了印地语翻译查询的所有可能组合,并从中选择最佳查询进行文档检索。实验在 FIRE 2010(信息检索评估论坛)数据集上进行。实验结果表明,所提出的方法赋予了英印 CLIR 系统更好的性能,同时有助于克服现有问题,并在平均精度上优于现有的英印 CLIR 系统。

关键词

引用

@article{arxiv.1401.3510,
  title  = {Improving Performance Of English-Hindi Cross Language Information Retrieval Using Transliteration Of Query Terms},
  author = {Saurabh Varshney and Jyoti Bajpai},
  journal= {arXiv preprint arXiv:1401.3510},
  year   = {2014}
}

备注

International Journal on Natural Language Computing (IJNLC) Vol. 2, No.6, December 2013 http://airccse.org/journal/ijnlc/index.html