中文

如何检测文本数据流中的新颖性?现有方法的比较研究

机器学习 2019-09-12 v1 信息检索 机器学习

摘要

由于在文档和/或词级别带有新颖性标注的数据集不易获取,我们提出一个仿真框架,可生成不同的文本数据集,并在其中控制新颖性出现的方式。我们还提出一个针对文本数据流中新颖性检测的现有方法的基准。我们定义了若干待解决任务,并比较了几种最先进的方法。该仿真框架使我们能够根据一组有限场景评估它们的性能,并测试它们对某些参数的敏感性。最后,我们在纽约时报标注数据集(New York Times Annotated Dataset)的不同类型新颖性上用相同方法进行了实验。

关键词

引用

@article{arxiv.1909.05099,
  title  = {How to detect novelty in textual data streams? A comparative study of existing methods},
  author = {Clément Christophe and Julien Velcin and Jairo Cugliari and Philippe Suignard and Manel Boumghar},
  journal= {arXiv preprint arXiv:1909.05099},
  year   = {2019}
}

备注

16 pages