ViLBias:检测和推理多模态内容中的偏见
人工智能
2026-02-24 v6
摘要
检测多模态新闻中的偏见需要能够对文本-图像对进行推理的模型,而不仅仅是对文本进行分类。为此,我们提出了 ViLBias,一个用于检测和推理多模态新闻偏见的 VQA 风格基准和框架。该数据集包含来自多家媒体机构的 40,945 个文本-图像对,每个样本都标注了偏见标签和简明理由,使用基于层次多数投票和人类在环验证的两阶段 LLM 标注管道。我们评估了小型语言模型 (SLM)、大型语言模型 (LLM) 和视觉-语言模型 (VLM) 在闭合式分类和开放式推理 (oVQA) 上的表现,并比较了参数高效调优策略。结果表明,纳入图像后可提高检测准确率 3-5%;LLM 和 VLM 能更好地捕捉到细微的框架及文本-图像不一致,而 SLM 能力较弱。参数高效方法 (LoRA/QLoRA/Adapters) 能在 <5% 可训练参数下恢复 97-99% 的完整微调性能。oVQA 的推理准确率在 52-79% 之间,忠实度在 68-89% 之间,均通过指令调优得到改善;闭合准确率与推理表现高度相关 (r = 0.91)。ViLBias 提供了一个可扩展的基准和强大的基线,用于多模态偏见检测和理由质量评估。
引用
@article{arxiv.2412.17052,
title = {ViLBias: Detecting and Reasoning about Bias in Multimodal Content},
author = {Shaina Raza and Caesar Saleh and Azib Farooq and Emrul Hasan and Franklin Ogidi and Haad Zahid and Maximus Powers and Marcelo Lotif and Anam Zahid and Karanpal Sekhon and Veronica Chatrath and Roya Javedi and Vahid Reza Khazaie and Zhenyu Yu},
journal= {arXiv preprint arXiv:2412.17052},
year = {2026}
}
备注
Under review