中文

将视觉内化为 LoRA

计算机视觉与模式识别 2025-03-27 v1 计算与语言

摘要

我们提出了 Vision as LoRA(VoRA)——一种将 LLM 转化为 MLLM 的新范式。不同于依赖外部视觉模块进行视觉编码的常见 MLLM 架构,VoRA 通过将视觉特定的 LoRA 层直接集成到 LLM 中来内化视觉能力。这种设计允许添加的参数在推理时无缝合并到 LLM 中,消除结构复杂性并最小化计算开销。此外,继承 LLM 处理灵活上下文的能力,VoRA 可以在任意分辨率下处理输入。为进一步加强 VoRA 的视觉能力,我们引入一种块级蒸馏方法,将预训练 ViT 中的视觉先验知识传递到 LoRA 层中,从而通过注入视觉知识加速训练。我们还应用双向注意力掩码更好地捕获图像的上下文信息。我们成功地证明了在额外的预训练数据下,VoRA 能够在常规基于编码的 MLLM 水平上进行表现。所有训练数据、代码和模型权重将发布于 https://github.com/Hon-Wong/VoRA。

关键词

引用

@article{arxiv.2503.20680,
  title  = {Vision as LoRA},
  author = {Han Wang and Yongjie Ye and Bingru Li and Yuxiang Nie and Jinghui Lu and Jingqun Tang and Yanjie Wang and Can Huang},
  journal= {arXiv preprint arXiv:2503.20680},
  year   = {2025}
}