中文

C-DLSI:一种面向联邦文本检索的扩展 LSI 方法

信息检索 2018-10-08 v1

摘要

随着网络在数据量与地理分布上的扩展,集中式搜索方法变得低效,导致对协作信息检索(如联邦文本检索(FTR))的兴趣日益增长。不同于现有的集中式信息检索(IR)方法在逻辑集中的文档集合上搜索,FTR 由若干对等节点组成,每个节点自身都是完整的搜索引擎。处理查询时,FTR 首先需要识别承载相关文档的有希望的对等节点,然后从所选节点检索最相关文档。现有多数方法仅应用传统 IR 技术,将每个文本集合视为单个大文档并利用词项匹配对集合排序。本文形式化该问题并识别 FTR 的特性,分析以聚类扩展 LSI 以适应 FTR 的可行性,并基于此提出一种称为基于聚类的分布式潜在语义索引(C-DLSI)的新方法。C-DLSI 通过聚类区分对等节点的主题,捕获簇内的局部 LSI 空间,并考虑这些 LSI 空间间的关系,从而提供更精确的节点刻画。相应地,提出了新的节点描述符与兼容的局部文本检索。实验结果表明 C-DLSI 优于现有方法。

关键词

引用

@article{arxiv.1810.02579,
  title  = {C-DLSI: An Extended LSI Tailored for Federated Text Retrieval},
  author = {Qijun Zhu and Dandan Li and Dik Lun Lee},
  journal= {arXiv preprint arXiv:1810.02579},
  year   = {2018}
}