MuSciClaims: 多模态科学主张验证
计算与语言
2025-07-31 v2
摘要
评估科学主张需要识别、提取并运用科学文献中以信息丰富图表形式表达的多模态数据。尽管在科学问答、图表描述及其他基于图表数据的多模态推理任务上已有大量研究,但目前缺乏可直接测试主张验证能力的可实用多模态基准数据集。为弥补这一空白,我们引入了一个新的基准数据集 MuSciClaims,并配套了诊断性任务。我们自动从科学文章中提取得到支持性主张,然后人工扰动以生成矛盾主张。这些扰动旨在测试特定的一组主张验证能力。我们还引入了一套诊断性任务,以帮助理解模型的失败原因。我们的结果表明,大多数视觉语言模型表现较差(F1 分数为 0.3-0.5),即使是最佳模型也仅达到 0.72 的 F1 分数。它们倾向于将主张判定为支持性的,可能误解了主张中细微的扰动。我们的诊断结果显示,模型在定位图表中正确证据方面能力差,跨模态信息聚合方面困难重重,甚至常常无法理解图表的基本组成。
引用
@article{arxiv.2506.04585,
title = {MuSciClaims: Multimodal Scientific Claim Verification},
author = {Yash Kumar Lal and Manikanta Bandham and Mohammad Saqib Hasan and Apoorva Kashi and Mahnaz Koupaee and Niranjan Balasubramanian},
journal= {arXiv preprint arXiv:2506.04585},
year = {2025}
}