PRISMM-Bench:基于同行评审来源的多模态不一致性基准
计算机视觉与模式识别
2025-10-21 v1
摘要
大型多模态模型(LMM)日益被应用于科学研究,但是否能够可靠地理解和推理论文的多模态复杂性仍不明确。核心挑战在于检测和解决文本、图表、表格和公式之间潜在的不一致性,这些问题往往微妙、领域特定,最终削弱了清晰度、可重复性和信任。现有基准要么仅关注单一模态,要么依赖人工生成的错误,无法真实再现实际场景的复杂性。我们引入 PRISMM-Bench(Peer-Review-sourced Inconsistency Set for Multimodal Models),即首个基于真实审稿人标记不一致性的基准。通过多阶段管道,包括审稿挖掘、LLM 辅助筛选和人工验证,我们精选了384个来自353篇论文的不一致性案例。基于此数据集,我们设计了三个任务,即不一致性识别、修复和配对匹配,评估模型在不同模态间的检测、纠错和推理能力。此外,为解决多选题评估中仅依赖选项捷径的尬症问题(即模型利用答案模式而非真正理解问题),我们进一步引入基于结构化 JSON 的答案表示,减少对表面风格线索的依赖。我们对21个领先的 LMM进行基准测试,包括大型开源模型(GLM-4.5V 106B、InternVL3 78B)和专有模型(Gemini 2.5 Pro、GPT-5 高推理模式)。结果显示表现极其不佳(27.8%-53.9%),凸显了多模态科学推理的挑战,并激励了向可信赖的科学助手发展。
引用
@article{arxiv.2510.16508,
title = {OOS-DSD: Improving Out-of-stock Detection in Retail Images using Auxiliary Tasks},
author = {Franko Šikić and Sven Lončarić},
journal= {arXiv preprint arXiv:2510.16508},
year = {2025}
}