GenRecal:从大型到小型视觉语言模型的再校准后的生成
计算与语言
2026-03-03 v3
摘要
近期视觉语言模型(VLM)的进展已利用大型语言模型(LLM)实现与GPT-4V等封闭源系统相当的性能。然而,在资源受限的设备上部署这些模型仍具有挑战性,由于其巨大的计算需求。这促使人们将知识从大型VLM蒸馏到更小更高效的替代方案。一个关键挑战在于,VLM架构基于不同的LLM,采用不同的token类型——在词汇表大小、token分割和token索引顺序方面存在差异。为解决此特定VLM类型的限制问题,我们提出生成后再校准(GenRecal),一个面向VLM的通用蒸馏框架。GenRecal包含一个再校准器,用于在异构VLM之间对齐和适应特征表示,从而实现跨不同VLM类型的有效知识迁移。通过在多个具有挑战性基准测试上的大量实验,我们展示了GenRecal显著改进了基线性能,最终超越了大规模开源和封闭源VLM。
引用
@article{arxiv.2506.15681,
title = {GenRecal: Generation after Recalibration from Large to Small Vision-Language Models},
author = {Byung-Kwan Lee and Ryo Hachiuma and Yong Man Ro and Yu-Chiang Frank Wang and Yueh-Hua Wu},
journal= {arXiv preprint arXiv:2506.15681},
year = {2026}
}
备注
Project page: https://byungkwanlee.github.io/GenRecal-page/