基于 LLM 代理的零样本视觉编码器嫁接
计算机视觉与模式识别
2025-08-05 v2
摘要
视觉语言模型 (VLMs) 通常将中等规模的视觉编码器与大型语言模型 (LLM) 配对,例如 Llama-70B,使得解码器在训练期间成为主要的计算负担。为了降低成本,一种潜在且有前景的策略是先使用小型语言模型训练视觉编码器,然后再将其迁移到大型模型上。我们通过直接继承大型目标 LLM 的浅层,构建了与其共享相同嵌入空间和表示语言的小型“代理模型”。在代理上训练的视觉编码器随后可以直接迁移到更大的模型上,我们将此过程称为零样本嫁接——当直接插入全尺寸目标 LLM 时,嫁接对的表现超越了编码器-代理对,并且在某些基准测试中,其表现甚至与使用目标 LLM 进行完整解码器训练相当。此外,当使用 Llama-70B 作为解码器时,我们的代理训练方法将整体 VLM 训练成本降低了约 45%。代码位于 https://github.com/facebookresearch/zero。
引用
@article{arxiv.2505.22664,
title = {Zero-Shot Vision Encoder Grafting via LLM Surrogates},
author = {Kaiyu Yue and Vasu Singla and Menglin Jia and John Kirchenbauer and Rifaa Qadri and Zikui Cai and Abhinav Bhatele and Furong Huang and Tom Goldstein},
journal= {arXiv preprint arXiv:2505.22664},
year = {2025}
}
备注
ICCV 2025