中文

基于规则的方法:通过解决音译搜索查询中的转录歧义进行词归一化

信息检索 2019-10-17 v1

摘要

查询词项与文档词项的匹配是任何尽力而为的信息检索模型(如向量空间模型)的基本功能。在我们基于短信的信息系统问题中,我们期望普通大众参与信息搜索。我们的系统允许移动用户用自己的词语、自己的音译风格和拼写形式来构造查询。为了实现这种灵活性,我们解决了由于用户查询词项中固有的转录噪声导致的词项级歧义。我们开发了一种基于规则的方法,为用户查询中的每个噪声词项选择最相关的、接近的标准词项。我们使用了四种不同版本的基于规则的算法,其规则集有所变化。我们制定了这个规则集,包括用于词项匹配的基本Levenshtein最小编辑距离算法。本文介绍了马拉地语和印地语文学信息系统的实验及相应结果。我们在马拉地语和印地语文学上进行了实验,包括歌曲、gazals、powadas、bharud和其他类型,采用标准音译形式如ITRANS。

关键词

引用

@article{arxiv.1910.07233,
  title  = {Rule based Approach for Word Normalization by resolving Transcription Ambiguity in Transliterated Search Queries},
  author = {Varsha Pathak and Manish Joshi},
  journal= {arXiv preprint arXiv:1910.07233},
  year   = {2019}
}

备注

11 pages, 2 figures, 2 tables, Unpublished