MisSpans:跨域虚假新闻中的细粒度虚假片段识别
计算与语言
2026-01-09 v1
摘要
在线虚假信息日益泛滥,然而大多数现有的基准和方法使用粗略的二元标签在完整的声明或段落级别评估真实性,掩盖了真实和虚假细节通常如何在单个句子中共存。这些简化也限制了可解释性:全局解释无法识别哪些特定片段具有误导性,也无法区分某个细节是如何虚假的(例如,扭曲与捏造)。为弥补这些不足,我们引入了 MisSpans,这是首个用于片段级虚假信息检测和分析的多领域、人工标注的基准,由成对的真实与虚假新闻故事组成。MisSpans 定义了三个互补任务:用于定位句子内虚假片段的 MisSpansIdentity,用于按虚假信息类型对虚假片段进行分类的 MisSpansType,以及用于提供基于已识别片段的理据的 MisSpansExplanation。这些任务共同实现了细粒度定位、超越真/假的细致刻画以及可操作的解释。专家标注员在标准化指南和一致性检查的指导下进行标注,实现了高标注者间一致性。我们在零样本和单样本设置下评估了 15 个具有代表性的 LLM,包括推理增强和非推理变体。结果揭示了细粒度虚假信息识别和分析的挑战性,并强调需要更深入地理解性能如何受到多种相互作用因素的影响,包括模型大小和推理能力,以及特定领域的文本特征。该项目将发布于 https://github.com/lzw108/MisSpans。
引用
@article{arxiv.2601.04857,
title = {MisSpans: Fine-Grained False Span Identification in Cross-Domain Fake News},
author = {Zhiwei Liu and Paul Thompson and Jiaqi Rong and Baojie Qu and Runteng Guo and Min Peng and Qianqian Xie and Sophia Ananiadou},
journal= {arXiv preprint arXiv:2601.04857},
year = {2026}
}
备注
Work in progress