VeriSciQA:基于自动验证的科学视觉问答数据集
计算机视觉与模式识别
2026-02-12 v3
摘要
大型视觉语言模型 (LVLMs) 在科学应用方面展现出巨大潜力,但开源模型在科学视觉问答 (SVQA) 中仍显吃力,即对来自科学论文图表的问题作答。一个关键瓶颈是缺乏公开的、大规模的、高质量的 SVQA 数据集。虽然最近的工作使用 LVLMs 大规模合成数据,但我们发现其生成的 QA 对存在系统性错误,这源于 LVLMs 本身的局限性以及图文之间信息的不对称。为此,我们提出了一种跨模态验证框架,该框架仅从图表引用段落中生成问题和答案,然后通过科学论文中固有的图文对齐方式对其进行验证,以筛选出错误的 QA 对。我们在此框架下构建了 VeriSciQA 数据集,包含 20,272 对 QA,对 20 个科学领域和 12 种图表类型进行了覆盖。难度评估显示,最佳开源模型准确率为 65%,而最佳专有模型准确率为 80.5%,显示出提升空间。此外,在 VeriSciQA 上微调的模型在 SVQA 数据集上实现持续的性能提升,提升幅度随数据规模而增大,超越在现有数据集上训练的模型。人类评估进一步验证了 VeriSciQA 提供的质量提升。这些结果表明,通过我们的可扩展框架继续扩大数据集可以进一步推动开源社区的 SVQA 能力发展。该数据集已公开提供于 https://huggingface.co/datasets/datajuicer/VeriSciQA。
引用
@article{arxiv.2511.19899,
title = {VeriSciQA: An Auto-Verified Dataset for Scientific Visual Question Answering},
author = {Yuyi Li and Daoyuan Chen and Zhen Wang and Yutong Lu and Yaliang Li},
journal= {arXiv preprint arXiv:2511.19899},
year = {2026}
}