HeBA:面向稳健视觉语言模型的异构瓶颈适配器
计算机视觉与模式识别
2026-03-18 v1
摘要
将大规模视觉语言模型(VLM)如CLIP适配到下游任务时,常因“通用尺度”架构方法而受限,即视觉和文本标记由宽而通用的适配器统一处理。我们认为这种均匀性忽略了两种模态的独特结构——图像中的空间局部性与文本中的语义稠密性。为此,我们提出HeBA(Heterogeneous Bottleneck Adapter),一个统一的架构框架,引入模态特定的结构归纳偏置。HeBA的设计与常规方法有显著区别,具体体现在三个关键架构创新方面:(1)异构性:它通过2D深度可分离卷积处理视觉标记,以保留空间相关性;而通过稠密线性投影处理文本标记,以捕获语义关系;(2)瓶颈正则化:不同于标准的扩展适配器,HeBA采用压缩瓶颈(D -> D/4),显式迫使模型学习紧凑且稳健的特征,作为结构正则器;(3)主动梯度初始化:我们挑战了限制性的零初始化范式,采用Kaiming初始化策略,确保足够的初始梯度流以加快收敛,同时不损害冻结主干网络的预训练知识。大量实验表明,HeBA的结构化专业设计在稳定性和准确性方面均优于现有方法,在11个few-shot基准上建立了新的最佳性能。代码已发布于https://github.com/Jahid12012021/VLM-HeBA。
关键词
引用
@article{arxiv.2603.16653,
title = {HeBA: Heterogeneous Bottleneck Adapters for Robust Vision-Language Models},
author = {Md Jahidul Islam},
journal= {arXiv preprint arXiv:2603.16653},
year = {2026}
}