中文

基于启发式搜索与k-means的网页搜索结果聚类

信息检索 2015-08-12 v1

摘要

为用户提供简单且组织良好的网页搜索结果一直是活跃的信息检索(IR)研究课题。无论查询多么简短或模糊,用户总是希望在IR系统的首次显示中就得到所需结果。对IR系统结果进行聚类可提供一条满足用户实际信息需求的途径。本文提出了一种对IR系统结果聚类的方法。该方法结合了启发式与采用余弦相似度的k-means技术。我们的启发式方法检测用于创建初始质心的k初始值。这消除了k值外部指定的问题,若指定错误可能导致不希望的结果。以这种方式创建的质心在网页搜索结果背景下更具体且有意义。所提方法的另一优势是去除了使簇大小相同的k-means目标均值函数。所提方法的最终结果由具有不同大小的不同文档簇组成。

关键词

引用

@article{arxiv.1508.02552,
  title  = {Web Search Result Clustering based on Heuristic Search and k-means},
  author = {Mansaf Alam and Kishwar Sadaf},
  journal= {arXiv preprint arXiv:1508.02552},
  year   = {2015}
}