VLsI:从大到小视觉语言模型的语言化图层-交互
计算机视觉与模式识别
2025-10-23 v2
摘要
近期,来自封闭源视觉语言模型(如 GPT-4V)生成的高质量视觉指令微调样本推动了开源 VLMs 在 various 模型规模上的快速释放。然而,使用更大的模型提升性能带来了显著的计算挑战,尤其是在面向移动平台和机器人等资源受限设备的部署方面。为此,我们提出 VLsI:Verbalized Layers-to-Interactions,这是一个新的 VLM 系列,包含 2B 和 7B 模型规模,强调在不牺牲准确性的前提下实现效率。VLsI 采用独特的层级蒸馏过程,引入中间的“语言化器”将每个层的特征映射到自然语言空间,使较小的 VLMs 能够灵活地对齐更大 VLMs 的推理过程。该方法缓解了通常在输出模仿中遇到的训练不稳定问题,超越典型的仅调校最终层,通过对齐小 VLMs 的层级进程与大 VLMs 一致。我们在十个具有挑战性的视觉语言基准测试中验证了 VLsI,实现了显著的性能提升(2B 模型提升 11.0%,7B 模型提升 17.4%),且无需模型规模、合并或架构更改。
引用
@article{arxiv.2412.01822,
title = {VLsI: Verbalized Layers-to-Interactions from Large to Small Vision Language Models},
author = {Byung-Kwan Lee and Ryo Hachiuma and Yu-Chiang Frank Wang and Yong Man Ro and Yueh-Hua Wu},
journal= {arXiv preprint arXiv:2412.01822},
year = {2025}
}
备注
CVPR 2025, Project page: https://byungkwanlee.github.io/VLsI-page/