数据中心视角下面向标准化考试问题的视觉语言模型精细调优
计算机视觉与模式识别
2025-12-02 v1 人工智能
计算与语言
计算机与社会
摘要
多模态推理已成为现代人工智能研究的基石。标准化考试问题为这类推理提供了独特严苛的测试环境,提供结构化的视觉语境和可验证的答案。尽管近期进展主要集中于算法方法(如强化学习:GRPO、DPO),但视觉语言推理的数据中心基础仍鲜有探索。我们表明,采用高质量数据进行监督式微调(SFT)即可与专有方法不相上下。为此,我们构建了一个由 16140 万标记的多模态数据集,组合教材问题-解答对、课程对齐图示和背景材料,并采用优化推理语法 (QMSA) 对 Qwen-2.5VL-32B 进行微调。该模型在我们新发布的基准 YKSUniform 上取得 78.6% 的准确率,仅低于 Gemini 2.0 Flash 1.0%。我们的结果揭示,数据构成和表征语法在多模态推理中发挥决定性作用。本工作为推进开源权重视觉语言模型提供了数据中心框架,表明精心策划且课程对齐的多模态数据可将监督式微调提升至接近最新水平的性能。
引用
@article{arxiv.2512.00042,
title = {Closing the Gap: Data-Centric Fine-Tuning of Vision Language Models for the Standardized Exam Questions},
author = {Egemen Sert and Şeyda Ertekin},
journal= {arXiv preprint arXiv:2512.00042},
year = {2025}
}