中文

面向文本图像科学 VQA 的简单数据增强策略

计算机视觉与模式识别 2025-09-25 v1

摘要

科学视觉问答因科学图图的复杂性及其多模态上下文,给视觉语言模型带来了显著挑战。传统方法将图图和随附文本(如问题和答案选项)视为独立输入。EXAMS-V 引入了新范式,通过将视觉和文本内容嵌入单个图像。然而,即使是最先进的专有模型在零样本设置下也表现不佳,这凸显了对特定任务微调的必要性。为解决此“文本图像”格式下训练数据的稀缺问题,本文通过将现有独立图像文本对转换为统一图像,合成了新数据集。对小型多语言多模态模型在我们的合成数据与 EXAMS-V 混合上的微调,在 13 种语言上均取得显著提升,显示出强劲的平均改进和跨语言迁移能力。

关键词

引用

@article{arxiv.2509.20119,
  title  = {A Simple Data Augmentation Strategy for Text-in-Image Scientific VQA},
  author = {Belal Shoer and Yova Kementchedjhieva},
  journal= {arXiv preprint arXiv:2509.20119},
  year   = {2025}
}

备注

Accepted at WiNLP, 2025