中文

真实世界数据收集驱动的在线欺骗检测

计算与语言 2017-08-01 v1

摘要

大规模真实数据集的缺乏是在线欺骗检测研究中的一个瓶颈。在本文中,我们应用一种基于社交网络分析的数据收集方法,从 Amazon 快速识别高质量的欺骗性和真实性在线评论。该数据集包含超过 10,000 条欺骗性评论,并且在产品领域和评论者方面具有多样性。利用该数据集,我们探索了跨领域表现良好的在线欺骗检测的有效通用特征。我们证明,借助泛化特征——广告用语和写作复杂度分数——通过在训练中增加来自不同领域的额外欺骗性评论,可以进一步提高欺骗检测性能。最后,评论者级别的评估对不同欺骗性评论者的写作风格提供了有趣的见解。

关键词

引用

@article{arxiv.1707.09406,
  title  = {Online Deception Detection Refueled by Real World Data Collection},
  author = {Wenlin Yao and Zeyu Dai and Ruihong Huang and James Caverlee},
  journal= {arXiv preprint arXiv:1707.09406},
  year   = {2017}
}

备注

10 pages, Accepted to Recent Advances in Natural Language Processing (RANLP) 2017