中文

MERIT:面向网络驱动推理的多模态误information检测模块化框架

人工智能 2026-04-28 v2 计算与语言 计算机视觉与模式识别 计算机与社会 机器学习

摘要

我们提出了MERIT,这是一个面向推理阶段的模块化框架,用于多模态误information检测,将验证过程分解为四个专门模块:视觉forensics、跨模态对齐、检索增强的claim验证以及校准的判断。在MMFakeBench上,MERIT采用GPT-4o-mini实现81.65%的F1分数,超越了所有报告的零样baseline,包括GPT-4V的MMD-Agent(74.0% F1)。受控相同模型评估确认,性能提升源于架构设计:在相同模型条件下,MERIT比MMD-Agent在误information召回率上高出6.14分,各类别提升分别为视觉失真+18.0、文本失真+5.33。消融研究揭示了模块专业化特征,删除任何模块都会在目标类别上产生不成比例的性能下降,而其他类别基本保持不变。测试集评估(5000样本)确认模型在验证集上的表现具有0.21分F1分数的泛化能力。该框架可与任何遵循指令的视觉语言模型配合使用,并生成带引用链接的理由供人类审阅。

关键词

引用

@article{arxiv.2510.17590,
  title  = {MERIT: Modular Framework for Multimodal Misinformation Detection with Web-Grounded Reasoning},
  author = {Mir Nafis Sharear Shopnil and Sharad Duwal and Abhishek Tyagi and Adiba Mahbub Proma},
  journal= {arXiv preprint arXiv:2510.17590},
  year   = {2026}
}

备注

18 pages, 4 tables, 3 figures. Major revision with updated title, framing, methodology, experiments, and error analysis