中文

Language-Unlocked ViT (LUViT):动用LLM赋能自监督视觉变换器

计算机视觉与模式识别 2025-07-10 v2

摘要

将大型语言模型(LLM)与视觉变换器(ViT)集成潜在巨大前景,用于仅凭视觉任务,借助LLM的丰富语义知识和推理能力。然而,根本性挑战在于LLM基于文本的预训练与ViT基于视觉的训练之间的本质模态错位。直接融合往往无法充分发挥LLM潜力,且在微调时存在不稳定问题。因此,LLM模块通常保持冻结状态,仅学习视觉组件。为缓解这些挑战,我们引入Language-Unlocked视觉变换器(LUViT),通过协同预训练策略桥接这种模态错位。LUViT通过(1)采用掩码自动编码(MAE)为ViT进行预训练以获得更丰富的视觉表征,(2)同时使用MAE目标对LLM中的低秩适配(LoRA)层进行训练来实现联合优化。这种联合优化引导ViT产生与LLM对齐的特征,使LLM能够有效解释视觉信息。我们通过大量实验表明,LUViT在各种下游视觉任务上的性能显著提升,展示了更有效更高效地发掘LLM知识以进行视觉理解的途径。

关键词

引用

@article{arxiv.2507.00754,
  title  = {Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs},
  author = {Selim Kuzucu and Muhammad Ferjad Naeem and Anna Kukleva and Federico Tombari and Bernt Schiele},
  journal= {arXiv preprint arXiv:2507.00754},
  year   = {2025}
}

备注

26 pages, 6 figures