Kterm Hashing 的参数化
信息检索
2022-08-03 v1
摘要
Kterm Hashing 为海量数据流上的新颖性检测提供了一种创新方法。先前的研究聚焦于最大化 Kterm Hashing 的效率,并成功将首故事检测(First Story Detection)扩展到 Twitter 规模的数据流而不牺牲检测精度。本文中,我们聚焦于提升 Kterm Hashing 的有效性。传统上,在计算文档相对于过去的新颖度时,所有 kterm 被视为同等重要。我们认为某些 kterm 比其他更重要,并假设均匀 kterm 权重对于确定数据流中的新颖性并非最优。为验证该假设,我们通过基于 kterm 特征分配权重来对 Kterm Hashing 进行参数化。我们的实验在首故事检测设定下应用 Kterm Hashing,揭示参数化 Kterm Hashing 能够超越最先进的检测精度,并显著优于均匀加权方法。
引用
@article{arxiv.2208.01340,
title = {Parameterizing Kterm Hashing},
author = {Dominik Wurzer and Yumeng Qin},
journal= {arXiv preprint arXiv:2208.01340},
year = {2022}
}
备注
Kterm Hashing, Novelty Detection, First Story Detection