面向MLLM的强健通用视觉主干网络:基于渐进特征细化的SAILViT
计算机视觉与模式识别
2025-07-03 v1
摘要
视觉Transformer(ViT)是建立多模态大语言模型(MLLM)视觉理解能力的基础主干网络。虽然大多数ViT通过基于图像-文本对的对比学习或自监督机制实现了卓越的性能,但它们在与LLM直接进行基于连接器的共训练时,由于潜在的参数初始化冲突和模态语义差距,难以直接参与。为了解决上述挑战,本文提出了SAILViT,这是一种基于渐进特征细化的ViT,旨在促进MLLM在复杂多模态交互中的突破性能瓶颈。SAILViT通过渐进特征细化实现粗到细的特征对齐和世界知识的引入,更好地服务于目标训练需求。我们进行了彻底的经验分析,确认了SAILViT在参数规模、模型架构、训练策略和数据规模等不同维度上的强大的鲁健性和通用性。配备SAILViT后,现有的MLLM在OpenCompass基准测试中的广泛下游任务上表现出显著且持续的性能提升。SAILViT系列模型已发布于https://huggingface.co/BytedanceDouyinContent。
引用
@article{arxiv.2507.01643,
title = {SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement},
author = {Weijie Yin and Dingkang Yang and Hongyuan Dong and Zijian Kang and Jiacong Wang and Xiao Liang and Chao Feng and Jiao Ran},
journal= {arXiv preprint arXiv:2507.01643},
year = {2025}
}
备注
We release SAILViT, a series of versatile vision foundation models