基于注意力特征适应的对比学习框架用于街景图像分类
计算机视觉与模式识别
2026-02-19 v1 人工智能
机器学习
摘要
街景图像属性分类是图像分类的下游关键任务,使能于自动驾驶、城市分析和高清地图构建等应用。无论是从头训练、使用预训练权重初始化还是微调大型模型,都面临计算挑战。虽然预训练的视觉语言模型如CLIP提供了丰富的图像表示,但现有的适应或微调方法往往依赖其全局图像嵌入,限制了其捕捉复杂街景环境中关键局部细粒度属性的能力。为此,我们提出了CLIP-MHAdapter,这是一种当前轻量级CLIP适应范式的变体,通过在补瓶MLP中引入多头自注意力机制,对patch标记进行建模,以捕捉patch间依赖关系。CLIP-MHAdapter仅需约140万可训练参数,便在全球街景数据集上的八个属性分类任务中实现了优异或竞争的准确率,达到了新的状态最优结果,同时保持低的计算成本。代码已公开于https://github.com/SpaceTimeLab/CLIP-MHAdapter。
引用
@article{arxiv.2602.16590,
title = {A Contrastive Learning Framework Empowered by Attention-based Feature Adaptation for Street-View Image Classification},
author = {Qi You and Yitai Cheng and Zichao Zeng and James Haworth},
journal= {arXiv preprint arXiv:2602.16590},
year = {2026}
}