SciVer:用于评估多模态科学主张验证的基础模型
计算与语言
2025-06-19 v1
摘要
我们提出SciVer,这是首个专为评估基础模型在多模态科学语境下验证主张能力而设计的基准。SciVer包含3000个由专家标注的示例,覆盖1113篇科学论文,包含四个子集,每个子集代表多模态科学主张验证中常见的推理类型。为实现细粒度评估,每个示例都包括专家标注的支持证据。我们评估了21个最先进的多模态基础模型,包括o4-mini、Gemini-2.5-Flash、Llama-3.2-Vision和Qwen2.5-VL。我们的实验发现,这些模型在SciVer上与人类专家之间存在显著的性能差距。通过对检索增强生成(RAG)的深入分析以及人工进行的错误评估,我们确定了当前开源模型的关键局限性,为推进模型在多模态科学文献任务中的理解和推理提供了关键见解。
引用
@article{arxiv.2506.15569,
title = {SciVer: Evaluating Foundation Models for Multimodal Scientific Claim Verification},
author = {Chengye Wang and Yifei Shen and Zexi Kuang and Arman Cohan and Yilun Zhao},
journal= {arXiv preprint arXiv:2506.15569},
year = {2025}
}