VLDBench:面向多模态虚假信息的评估基准
计算与语言
2025-12-23 v5
摘要
检测融合人为操纵文本和图像的虚假信息变得越来越具有挑战性,因为人工智能工具使得合成内容的生成和传播变得容易。虽然大多数现有人工智能安全基准关注单一模态虚假信息(即无误欺骗意图的虚假内容),但意图型多模态虚假信息(如宣传或阴谋论,模仿可信新闻)仍 largely 未被 addressing。我们介绍了视觉-语言虚假信息检测基准 (VLDBench),这是第一个支持单模态(文本-only)和多模态(文本+图像)虚假信息检测的大型资源。VLDBench 包含约62,000个带标签的文本-图像对,涵盖13个类别,来自58个新闻机构。我们采用半自动化流程并经专家审核,22名领域专家投入超过500小时,制作出高质量的注释,具有显著的注释者间一致性。在VLDBench上对现有大型语言模型 (LLM) 和视觉-语言模型 (VLM) 的评估表明,纳入视觉线索可使检测准确率提高5至35个百分点。VLDBench 提供数据和代码,用于评估、微调和鲁棒性测试,以支持虚假信息分析。VLDBench 依据人工智能治理框架(如MIT AI风险存储库)开发,为推动可信多模态媒体虚假信息检测提供原则性基础。项目:https://vectorinstitute.github.io/VLDBench/ 数据集:https://huggingface.co/datasets/vector-institute/VLDBench 代码:https://github.com/VectorInstitute/VLDBench
引用
@article{arxiv.2502.11361,
title = {VLDBench Evaluating Multimodal Disinformation with Regulatory Alignment},
author = {Shaina Raza and Ashmal Vayani and Aditya Jain and Aravind Narayanan and Vahid Reza Khazaie and Syed Raza Bashir and Elham Dolatabadi and Gias Uddin and Christos Emmanouilidis and Rizwan Qureshi and Mubarak Shah},
journal= {arXiv preprint arXiv:2502.11361},
year = {2025}
}
备注
Accepted in Information Fusion Journal