中文

SpecVQA:科学图像中光谱理解与视觉问答的基准

人工智能 2026-05-01 v1

摘要

光谱是一种普遍存在但信息高度密集的科学图像形式,由于其非结构化和领域特定的特性,对多模态大语言模型 (MLLM) 构成了重大挑战。在此,我们介绍 SpecVQA,这是一个专业的科学图像基准,用于评估多模态模型在科学光谱理解方面的能力,涵盖 7 种具有代表性的光谱类型,并配有专家标注的问答对。其目标包括两个方面:光谱科学问答评估和相应的底层任务评估。SpecVQA 包含从同行评审文献中精选的 620 张图和 3100 个问答对,同时针对直接信息提取和领域特定推理。为了在保留基本曲线特征的同时有效减少令牌长度,我们提出了一种光谱数据采样和插值重建方法。消融研究进一步证实,该方法在所提出的基准上实现了显著的性能提升。我们在我们的基准上测试了主流 MLLM 在科学光谱理解方面的能力,并呈现了一个排行榜。这项工作代表了增强多模态大模型光谱理解能力的关键一步,并为将视觉-语言模型扩展到更广泛的科学研究和数据分析指明了有前景的方向。

关键词

引用

@article{arxiv.2604.28039,
  title  = {SpecVQA: A Benchmark for Spectral Understanding and Visual Question Answering in Scientific Images},
  author = {Jialu Shen and Han Lyu and Suyang Zhong and Hanzheng Li and Haoyi Tao and Nan Wang and Changhong Chen and Xi Fang},
  journal= {arXiv preprint arXiv:2604.28039},
  year   = {2026}
}