中文

自然语言技术与查询扩展:问题、现状与展望

信息检索 2020-04-24 v1 计算与语言

摘要

海量知识源的可得性激发了大量关于信息检索技术开发与增强的工作。用户的信息需求以自然语言表述,成功的检索在很大程度上依赖于对预期目的的有效传达。自然语言查询由多种语言特征构成,用以表示预期的搜索目标。导致语义歧义与查询误解的语言特征,以及缺乏对搜索环境熟悉度等附加因素,影响了用户准确表示其信息需求的能力,这被“意图鸿沟”概念所概括。后者直接影响返回搜索结果的相关性,可能不尽如用户满意,因此是影响信息检索系统有效性的一个主要问题。我们讨论的核心在于识别刻画查询意图的重要成分,并通过手动或自动添加有意义的词项、短语甚至潜在表示来丰富它们以捕获预期含义。具体地,我们讨论实现丰富的技术,尤其是那些利用从文档语料库中词项依赖的统计处理或从本体等外部知识源收集的信息的技术。我们给出了一个基于通用语言的查询扩展框架的结构,并提出了其基于模块的分解,涵盖查询处理、信息检索、计算语言学和本体工程中的主题问题。对于每个模块,我们在所用技术视角下对文献中的最新解决方案进行了分类与分析。

关键词

引用

@article{arxiv.2004.11093,
  title  = {Natural language technology and query expansion: issues, state-of-the-art and perspectives},
  author = {Bhawani Selvaretnam and Mohammed Belkhatir},
  journal= {arXiv preprint arXiv:2004.11093},
  year   = {2020}
}