通过不一致性误导:一个政治不一致性检测基准
计算与语言
2025-05-27 v1
摘要
不一致的政治声明构成了一种虚假信息。如果不被察觉,它们会侵蚀公众信任并对问责制构成挑战。自动检测不一致性可以协助记者提出澄清问题,从而帮助保持政客的问责。我们提出了不一致性检测任务,并开发了不一致性类型量表,以推动此方向的 NLP 研究。为了提供检测政治领域不一致性的资源,我们呈现了一个包含 698 对人工标注政治声明的数据集,其中 237 个样本带有标注者推理过程的解释。这些声明主要来自德国的 Wahl-O-Mat 和瑞士的 Smartvote 等投票助手平台,反映了真实世界的政治议题。我们在我们的数据集上对大型语言模型 进行了基准测试,结果表明,总体而言,它们在检测不一致性方面与人类一样好,甚至在预测众包标注的真实标签方面可能优于个体人类。然而,在识别细粒度的不一致性类型时,没有模型达到性能上限(由于自然标注差异),因此仍有改进空间。我们公开了我们的数据集和代码。
引用
@article{arxiv.2505.19191,
title = {Misleading through Inconsistency: A Benchmark for Political Inconsistencies Detection},
author = {Nursulu Sagimbayeva and Ruveyda Betül Bahçeci and Ingmar Weber},
journal= {arXiv preprint arXiv:2505.19191},
year = {2025}
}
备注
8 pages, 6 figures. Accepted for publication in the Proceedings of 1st Workshop on Misinformation Detection in the Era of LLMs (MisD) at ICWSM-2025