Mafiascum 数据集:一个用于欺骗检测的大型文本语料库
计算与语言
2019-08-15 v3
摘要
在自然语言中检测欺骗具有广泛的应用,但由于其隐蔽性,目前尚无公开的、大规模带标注的欺骗文本来源。本文介绍了 Mafiascum 数据集 [1],其包含 700 多局 Mafia 游戏,玩家被随机分配欺骗或非欺骗角色,并通过论坛发帖进行互动。从该数据集中整理出 9000 多篇文档,每篇包含单个玩家在单局游戏中所写的所有消息。该语料库被用于构建一组基于先前欺骗研究手工选取的语言特征,以及一组 enriched with subword information 的平均词向量。在结合这些特征集上拟合的逻辑回归分类器,在 5000+ 词的文档上取得了 0.39 的平均精度(随机 = 0.26)和 0.68 的 AUROC;在 50+ 词的文档上取得了 0.29 的平均精度(随机 = 0.23)和 0.59 的 AUROC。[1] https://bitbucket.org/bopjesvla/thesis/src
引用
@article{arxiv.1811.07851,
title = {The Mafiascum Dataset: A Large Text Corpus for Deception Detection},
author = {Bob de Ruiter and George Kachergis},
journal= {arXiv preprint arXiv:1811.07851},
year = {2019}
}