中文

多层文本摘要模型对基于向量空间的信息检索效率与相关性的影响

信息检索 2020-04-29 v1

摘要

互联网上海量文本的上传在信息检索系统中产生了庞大的倒排索引,损害了其效率。本研究旨在衡量自动文本摘要的多层相似度模型对在 IR 系统中构建信息丰富且精简的倒排索引的影响。为实现此目的,我们使用多层相似度模型对大量文档进行摘要,并基于该模型生成的自动摘要构建倒排索引。我们开展了一系列实验以测试效率与相关性方面的性能。实验包含与三种现有文本摘要模型的比较:Jaccard 系数模型、向量空间模型与潜在语义分析模型。实验考察了三组查询,并采用人工与自动相关性评估。多层相似度对 IR 系统效率的积极影响显而易见,且相关性结果无显著损失。然而,评估显示无语义考察的传统统计模型未能改善信息检索效率。与先前探讨以摘要作为索引来源的文献相比,我们工作的相关性评估更高,且多层相似度检索构建的倒排索引比主语料倒排索引小 58%。

关键词

引用

@article{arxiv.2004.13136,
  title  = {The Effect of the Multi-Layer Text Summarization Model on the Efficiency and Relevancy of the Vector Space-based Information Retrieval},
  author = {Ahmad Hussein Ababneh and Joan Lu and Qiang Xu},
  journal= {arXiv preprint arXiv:2004.13136},
  year   = {2020}
}