如何检测文本数据流中的新颖性?现有方法的比较研究
机器学习
2019-09-12 v1 信息检索
机器学习
摘要
由于在文档和/或词级别带有新颖性标注的数据集不易获取,我们提出一个仿真框架,可生成不同的文本数据集,并在其中控制新颖性出现的方式。我们还提出一个针对文本数据流中新颖性检测的现有方法的基准。我们定义了若干待解决任务,并比较了几种最先进的方法。该仿真框架使我们能够根据一组有限场景评估它们的性能,并测试它们对某些参数的敏感性。最后,我们在纽约时报标注数据集(New York Times Annotated Dataset)的不同类型新颖性上用相同方法进行了实验。
引用
@article{arxiv.1909.05099,
title = {How to detect novelty in textual data streams? A comparative study of existing methods},
author = {Clément Christophe and Julien Velcin and Jairo Cugliari and Philippe Suignard and Manel Boumghar},
journal= {arXiv preprint arXiv:1909.05099},
year = {2019}
}
备注
16 pages