中文

激活 LLMs 中的分布式视觉区域以实现高效且有效的视觉-语言训练与推理

计算机视觉与模式识别 2025-03-24 v2

摘要

大型视觉-语言模型 通常通过视觉指令微调来学习视觉能力,这涉及对投影器及其 LLM 主干两者的更新。受人脑中视觉区域概念的启发,我们研究了 LLMs 中是否存在一个作为认知核心的类似“视觉区域”,并探索了通过选择性层调优实现 LVLMs 高效训练的潜力。使用 Bunny-Llama-3-8B-V 进行详细分析,并使用另外三种 LVLMs 在多样化的视觉和文本任务上进行验证,我们发现,选择性地更新 25% 的 LLMs 层(当其稀疏且均匀分布时),能够保留近 99% 的视觉性能,并维持或提升文本任务结果,同时有效减少训练时间。基于这种有针对性的训练方法,我们进一步提出了一种新颖的基于视觉区域的剪枝范式,移除视觉区域之外的非关键层,这可以实现最小的性能损失。本研究通过激活 LLMs 内基于层的视觉区域,为 LVLM 训练和推理提供了一种有效且高效的策略,并证明该方法在不同模型上均持续有效。

关键词

引用

@article{arxiv.2412.12785,
  title  = {Activating Distributed Visual Region within LLMs for Efficient and Effective Vision-Language Training and Inference},
  author = {Siyuan Wang and Dianyi Wang and Chengxing Zhou and Zejun Li and Zhihao Fan and Xuanjing Huang and Zhongyu Wei},
  journal= {arXiv preprint arXiv:2412.12785},
  year   = {2025}
}