基于上下文的信息过滤中的新颖性与覆盖度
信息检索
2018-11-27 v1
摘要
我们提出了一系列算法,用于过滤文档流,使得过滤后的文档尽可能好地覆盖一个人的兴趣,同时考虑到在任何给定时刻,所提供的文档不仅应当相关,而且应当多样化——这不仅意味着避免近乎相同的文档,还意味着尽可能好地覆盖该个人的所有兴趣。我们使用经过有限架构调整的 WEBSOM 算法的改进版本,基于在词空间中布局并采用代表该上下文的文档集合训练得到的单元网络,来创建用户模型(我们称之为“用户上下文”或简称“上下文”)。我们引入了新颖性与覆盖度的概念。新颖性与同名的信息检索概念相关但不完全相同:如果一篇文档属于某人在最近一段时间内未见过文档的感兴趣语义区域,则该文档是新颖的。一组文档的覆盖度,是指其在多大程度上能良好地表示该个人的所有兴趣。为了提高覆盖度,我们为用户模型的每个单元引入一个“兴趣”(或“紧迫度”)因子,该因子由 incoming 文档的得分调节:当属于某单元语义区域的文档到达时,该单元的兴趣会急剧下降;若没有来自该语义区域的文档被展示,则其兴趣会缓慢恢复至初始值。我们的测试表明,这些算法能够在不严重影响准确率的情况下,有效提高展示给用户文档的覆盖度。
引用
@article{arxiv.1811.09835,
title = {Novelty and Coverage in context-based information filtering},
author = {Alexandra Dumitrescu and Simone Santini},
journal= {arXiv preprint arXiv:1811.09835},
year = {2018}
}
备注
26 pages, 16 figures, 5 tables