中文

面向大型网络数据集的高效且有效的垃圾过滤与重排序

信息检索 2015-03-17 v1

摘要

TREC 2009 网络 ad hoc 和相关性反馈任务使用了一个新的文档集合——ClueWeb09 数据集,该数据集于 2009 年初从通用网络中抓取。该数据集包含 10 亿个网页,其中相当一部分是垃圾网页——旨在欺骗搜索引擎以传递有害负载的页面。我们研究了垃圾信息对使用 ClueWeb09 数据集的 TREC 2009 网络 ad hoc 和相关性反馈任务结果的影响。我们表明,一个简单的基于内容的分类器,只需极少的训练,就足以在 48 小时内使用一台标准个人计算机对数据集中每个页面的“垃圾程度”进行排序,并且其有效性足以在几乎所有提交的运行结果中,在固定截断精度 (estP10) 以及排序度量 (estR-Precision, StatMAP, MAP) 上产生显著且实质性的改进。此外,使用一组“蜜罐”查询,可以将训练数据的标注简化为完全自动化的过程。经典信息检索方法的结果通过过滤得到了特别增强——从最差的结果变为最佳的结果之一。

关键词

引用

@article{arxiv.1004.5168,
  title  = {Efficient and Effective Spam Filtering and Re-ranking for Large Web Datasets},
  author = {Gordon V. Cormack and Mark D. Smucker and Charles L. A. Clarke},
  journal= {arXiv preprint arXiv:1004.5168},
  year   = {2015}
}