M2-Verify:用于检验多模态声明一致性的多领域大规模基准测试
计算与语言
2026-04-21 v3
摘要
评估科学论证需要检验声明与其底层多模态证据之间的严格一致性。然而,现有基准缺乏评估这种对齐关系所需的规模、领域多样性和视觉复杂性。为了填补这一空白,我们引入了 M2-Verify,一个用于检验科学声明一致性的多模态大规模数据集。该数据集来源于 PubMed 和 arXiv,涵盖 16 个领域,提供超过 46.9 万个实例,并经过专家审计严格验证。广泛的基线实验表明,最先进的模型难以维持稳健的一致性。尽管顶级模型在低复杂度医学扰动上达到了高达 85.8% 的 Micro-F1,但在解剖学偏移等高复杂度挑战上性能下降至 61.6%。此外,专家评估揭示了模型在为其对齐决策生成科学解释时产生的幻觉。最后,我们展示了数据集的实用性并提供了全面的使用指南。
引用
@article{arxiv.2604.01306,
title = {M2-Verify: A Large-Scale Multidomain Benchmark for Checking Multimodal Claim Consistency},
author = {Abolfazl Ansari and Delvin Ce Zhang and Zhuoyang Zou and Wenpeng Yin and Dongwon Lee},
journal= {arXiv preprint arXiv:2604.01306},
year = {2026}
}
备注
Preprint. Under Review