SEPSIS:我能识破你的谎言——一种欺骗检测新范式
计算与语言
2025-07-08 v2
摘要
欺骗是有意歪曲信息的行为。它是一种微妙的社会实践,与人类社会发展深度交织,具有多面性。本研究从心理学视角探讨欺骗问题,采用将欺骗分为三种形式的框架:遗漏型谎言、捏造型谎言和影响型谎言。本研究主要关注且仅调查遗漏型谎言。我们提出了一种利用 NLP 技术的欺骗检测新框架。我们通过合并一个流行的大规模假新闻数据集与从知名印度新闻媒体 Times of India 的 Twitter 账号抓取的新闻标题,整理出含 876,784 个样本的标注数据集。每个样本标注有四个层次,即:(i) 遗漏类型(猜测、偏见、扭曲、听起来像事实、观点),(ii) 谎言色彩(黑色、白色等),(iii) 此类谎言的意图(影响等),(iv) 谎言主题(政治、教育、宗教等)。我们提出了一种新颖的多任务学习流水线,利用微调语言模型的无数据合并来解决前述欺骗检测任务。我们提出的模型取得了 0.87 的 F1 分数,在所有层次(包括欺骗内容的类型、色彩、意图和主题方面)均展现出强劲性能。最后,我们的研究探讨了遗漏型谎言与宣传手法之间的关系。为此,我们进行了深入分析,揭示了引人注目的发现。例如,分析显示负载语言与观点之间存在显著相关性,阐明了二者的互联性。为鼓励该领域进一步研究,我们在 https://huggingface.co/datasets/ankurani/deception 发布 SEPSIS 数据集与代码。
引用
@article{arxiv.2312.00292,
title = {SEPSIS: I Can Catch Your Lies -- A New Paradigm for Deception Detection},
author = {Anku Rani and Dwip Dalal and Shreya Gautam and Pankaj Gupta and Vinija Jain and Aman Chadha and Amit Sheth and Amitava Das},
journal= {arXiv preprint arXiv:2312.00292},
year = {2025}
}
备注
ACL SRW 2025