中文

基于大语言模型的视觉编码器层次预训练

计算机视觉与模式识别 2026-04-02 v1 人工智能 计算与语言 机器学习

摘要

计算机视觉领域通过可扩展的视觉编码器和多模态预训练框架实现了显著进展。然而,现有方法常将视觉编码器和大语言模型(LLM)视为独立模块,限制了层次化视觉特征的集成。本文提出HIVE(Hierarchical Pre-Training of Vision Encoders),一种新型框架,通过在视觉编码器与LLM之间引入层次化交叉注意力,增强视觉-语言对齐。不同于常规方法将图像嵌入展平,HIVE实现跨多层的结构化特征融合,改善梯度流和表征学习。为优化此交互,我们引入三阶段训练策略,逐步对齐视觉编码器与LLM,确保稳定优化和有效的多模态融合。实证评估表明,HIVE在图像分类以及各种视觉-语言任务中均实现卓越性能,在MME、GQA、OK-VQA和ScienceQA等基准测试中超越基于自注意力的方法。我们的结果凸显了层次化特征集成的优势,为更高效和更具表达力的视觉-语言模型指明了方向。

关键词

引用

@article{arxiv.2604.00086,
  title  = {Hierarchical Pre-Training of Vision Encoders with Large Language Models},
  author = {Eugene Lee and Ting-Yu Chang and Jui-Huang Tsai and Jiajie Diao and Chen-Yi Lee},
  journal= {arXiv preprint arXiv:2604.00086},
  year   = {2026}
}

备注

17 pages, 14 figures, accepted to Computer Vision and Pattern Recognition Conference (CVPR) Workshops 2026. 5th MMFM Workshop: What is Next in Multimodal Foundation Models?