UNIDECOR:面向跨语料欺骗检测的统一欺骗语料库
计算与语言
2023-06-09 v2
摘要
言语欺骗在心理学、法医学和计算语言学等领域因多种原因被研究,例如理解行为模式、识别虚假证词以及检测在线交流中的欺骗。不同研究领域的动机差异导致所研究领域的选择以及对欺骗的概念化存在差异,使得针对给定语言难以比较模型并构建鲁棒的欺骗检测系统。在本文中,我们通过调研可用的英文欺骗数据集来改善这一状况,这些数据集涵盖社交媒体评论、法庭证词、特定话题的观点陈述以及来自在线策略游戏的欺骗性对话等领域。我们将这些数据集整合为一个统一的语料库。基于该资源,我们对各数据集中欺骗的语言线索进行相关性分析以理解其差异,并开展跨语料建模实验,结果表明实现跨领域泛化具有挑战性。该统一欺骗语料库(UNIDECOR)可从 https://www.ims.uni-stuttgart.de/data/unidecor 获取。
引用
@article{arxiv.2306.02827,
title = {UNIDECOR: A Unified Deception Corpus for Cross-Corpus Deception Detection},
author = {Aswathy Velutharambath and Roman Klinger},
journal= {arXiv preprint arXiv:2306.02827},
year = {2023}
}