ConvLLaVA:层次化主干网络作为大型多模态模型的视觉编码器
计算机视觉与模式识别
2024-05-27 v1
摘要
高分辨率大型多模态模型(LMM)面临视觉标记过多和视觉复杂度二次增长的挑战。当前的高分辨率LMM解决了二次复杂度问题,但仍然产生过多的视觉标记。然而,视觉标记的冗余是关键问题,因为它导致更大的计算量。为了缓解这个问题,我们提出了ConvLLaVA,它采用层次化主干网络ConvNeXt作为LMM的视觉编码器,以替代视觉变换器(ViT)。ConvLLaVA将高分辨率图像压缩为信息丰富的视觉特征,有效防止了过多视觉标记的产生。为了增强ConvLLaVA的能力,我们提出了两个关键优化。由于低分辨率预训练的ConvNeXt直接应用于高分辨率时性能不佳,我们对其进行了更新以弥合差距。此外,由于ConvNeXt的原始压缩比对于更高分辨率的输入不足,我们训练了一个后续阶段来进一步压缩视觉标记,从而减少冗余。这些优化使ConvLLaVA能够支持1536×1536分辨率的输入,仅生成576个视觉标记,并能处理任意宽高比的图像。实验结果表明,我们的方法在主流基准测试中达到了与最先进模型竞争的性能。ConvLLaVA模型系列可在https://github.com/alibaba/conv-llava公开获取。
引用
@article{arxiv.2405.15738,
title = {ConvLLaVA: Hierarchical Backbones as Visual Encoder for Large Multimodal Models},
author = {Chunjiang Ge and Sijie Cheng and Ziming Wang and Jiale Yuan and Yuan Gao and Jun Song and Shiji Song and Gao Huang and Bo Zheng},
journal= {arXiv preprint arXiv:2405.15738},
year = {2024}
}
备注
17 pages