DiFaR:利用多样化、事实性且相关的理由增强多模态虚假信息检测
计算与语言
2025-08-15 v1
摘要
从大型视觉语言模型(LVLM)生成文本理由以支持可训练的多模态虚假信息检测器,已成为一种有前景的范式。然而,其有效性从根本上受到三个核心挑战的限制:(i) 生成的理由多样性不足,(ii) 因幻觉导致的事实不准确,以及 (iii) 引入噪声的不相关或冲突内容。我们引入了 DiFaR,一个与检测器无关的框架,可生成多样化、事实性且相关的理由以增强虚假信息检测。DiFaR 采用五种思维链提示从 LVLM 中引出多样的推理轨迹,并整合了一个轻量级的事后过滤模块,基于句子级事实性和相关性分数来选择理由句子。在四个流行基准上的大量实验表明,DiFaR 的性能比四类基线方法高出多达 5.9%,并将现有检测器的性能提升了多达 8.7%。自动评估指标和人工评估均证实,DiFaR 在所有三个维度上显著提高了理由质量。
引用
@article{arxiv.2508.10444,
title = {DiFaR: Enhancing Multimodal Misinformation Detection with Diverse, Factual, and Relevant Rationales},
author = {Herun Wan and Jiaying Wu and Minnan Luo and Xiangzheng Kong and Zihan Ma and Zhi Zeng},
journal= {arXiv preprint arXiv:2508.10444},
year = {2025}
}