一种利用SERPs进行Web查询二元领域分类的监督学习算法
信息检索
2016-05-04 v2
摘要
通用搜索引擎(SEs)抓取网络的所有领域(如体育、新闻、娱乐),但有时查询的信息需求局限于特定领域(如医学)。我们利用SEs的工作,作为将特定领域查询路由至本地数字图书馆(DLs)的努力的一部分。即使对于某些类型查询SEs并非“最佳”来源,它们也常被使用。相较于告知用户“对此类查询请使用此DL”,我们旨在自动检测查询何时可由本地DL(例如私有的、访问受控的、无法被SEs抓取的DL)更好地服务。这不是一项简单任务,因为Web查询简短、模糊,且缺乏高质量标注训练数据(或创建成本高昂)。为检测应路由至本地专用DLs的查询,我们首先将查询发送至Google,然后检查所得搜索引擎结果页(SERPs)中的特征,接着将查询分类为属于学术或非学术领域。使用来自非学术领域的400,000条AOL查询和来自学术领域的NASA技术报告服务器(NTRS)的400,000条查询,我们的分类器达到了0.809的准确率和0.805的F值。
引用
@article{arxiv.1605.00184,
title = {A Supervised Learning Algorithm for Binary Domain Classification of Web Queries using SERPs},
author = {Alexander Nwala and Michael Nelson},
journal= {arXiv preprint arXiv:1605.00184},
year = {2016}
}
备注
Figure 6. fix