大模型训练小模型:利用小型视觉语言模型实现高效视觉问答的无标签模型对等对齐
计算机视觉与模式识别
2025-09-23 v1 人工智能
计算与语言
摘要
大型视觉语言模型(L-VLMs)在包括视觉问答(VQA)在内的各种视觉和语言任务中展现了卓越的性能。然而,其高昂的计算成本使其不适用于资源受限的环境和推理密集型应用。相比之下,小型视觉语言模型(S-VLMs)虽具有效率优势,但与大型模型相比存在显著的性能差距。在这项工作中,我们引入了模型对等对齐器(MPA),这是一个新颖的框架,旨在通过利用无标签图像和来自 L-VLMs 的有效知识迁移,系统性地提升 S-VLMs。不同于依赖有标签训练数据的传统知识蒸馏方法,MPA 采用一种策略性的基于对等的方法,精确识别 S-VLMs 与 L-VLMs 之间的知识差距,并仅针对这些差距优化训练。我们在四个不同的 VQA 基准上进行了广泛实验,即 TextVQA、ST-VQA、ChartQA 和 OKVQA,每个基准都需要专门的推理能力,如文本识别、图表解释以及常识和事实理解。我们的结果表明,MPA 在所有基准上持续提升了 S-VLMs 的性能,在保持计算效率的同时缩小了性能差距。我们公开了代码。
引用
@article{arxiv.2509.16633,
title = {When Big Models Train Small Ones: Label-Free Model Parity Alignment for Efficient Visual Question Answering using Small VLMs},
author = {Abhirama Subramanyam Penamakuri and Navlika Singh and Piyush Arora and Anand Mishra},
journal= {arXiv preprint arXiv:2509.16633},
year = {2025}
}
备注
Accepted to EMNLP (Main) 2025