中文

通过多模态推理与集成建模提升科学视觉问答

计算机视觉与模式识别 2025-07-09 v1

摘要

技术报告和文章常以表格、图表和图形等半结构化数据形式包含宝贵信息。对这些信息进行解读并利用其中的数据对于下游任务如问答(QA)至关重要。当前的视觉问答方法在处理科学数据解读时常常难以满足精确要求,尤其在处理数值、对视觉元素进行多步推理以及保持视觉观察与文本推理之间的一致性方面。我们为 SciVQA 2025 共享任务提交了自己的方案,专注于回答基于学术文章中科学图表的视觉和非视觉问题。我们进行了一系列实验,使用参数量在 5B 到 8B 的模型。我们最强的单个模型 InternVL3 在 SciVQA 测试集上获得了 ROUGE-1 和 ROUGE-L F1 分别为 \textbf{0.740} 和 \textbf{0.983}。我们还开发了一个包含多个视觉语言模型(VLM)的集成模型。通过对验证集进行错误分析,我们的集成方法在大多数单个模型上都有所提升,尽管 InternVL3 仍是最强的独立模型。我们的发现强调了提示优化、链式思考推理和集成建模在提升模型视觉问答能力方面的有效性。

关键词

引用

@article{arxiv.2507.06183,
  title  = {Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling},
  author = {Prahitha Movva and Naga Harshita Marupaka},
  journal= {arXiv preprint arXiv:2507.06183},
  year   = {2025}
}