中文

Kterm Hashing 的参数化

信息检索 2022-08-03 v1

摘要

Kterm Hashing 为海量数据流上的新颖性检测提供了一种创新方法。先前的研究聚焦于最大化 Kterm Hashing 的效率,并成功将首故事检测(First Story Detection)扩展到 Twitter 规模的数据流而不牺牲检测精度。本文中,我们聚焦于提升 Kterm Hashing 的有效性。传统上,在计算文档相对于过去的新颖度时,所有 kterm 被视为同等重要。我们认为某些 kterm 比其他更重要,并假设均匀 kterm 权重对于确定数据流中的新颖性并非最优。为验证该假设,我们通过基于 kterm 特征分配权重来对 Kterm Hashing 进行参数化。我们的实验在首故事检测设定下应用 Kterm Hashing,揭示参数化 Kterm Hashing 能够超越最先进的检测精度,并显著优于均匀加权方法。

关键词

引用

@article{arxiv.2208.01340,
  title  = {Parameterizing Kterm Hashing},
  author = {Dominik Wurzer and Yumeng Qin},
  journal= {arXiv preprint arXiv:2208.01340},
  year   = {2022}
}

备注

Kterm Hashing, Novelty Detection, First Story Detection