面向长尾视觉识别的基础模型语义引导微调
计算机视觉与模式识别
2025-07-18 v1
摘要
长尾场景中各类别样本大小的差异常导致对样本较少的类别表现下降。值得注意的是,基础模型在大规模开放世界数据集上预训练,展现出强大的通用表征潜力,这为在预训练模型上开发自适应策略提供了可能。先进的微调方法通常只调整视觉编码器,忽略了来自冻结文本编码器的语义信息,未能充分发挥视觉与文本对齐的潜力。为强化这种对齐,本文提出一种新方法:面向长尾视觉识别的基础模型语义引导微调(Sage),将文本模态中派生的语义指导信息融入视觉微调过程中。具体而言,我们引入 SG-Adapter,将类别描述作为语义指导信息,引导视觉编码器的微调。所引入的指导信息通过注意力机制传递,使模型能够更聚焦于语义相关内容,从而加强了视觉与文本模态之间的对齐。由于现有损失函数忽略了类别条件分布的不一致性,导致预测偏差,即使在多模态对齐得到加强后,尾部类别的性能提升仍小于头部类别。为解决这一挑战,我们提出一种新型分布不匹配感知补偿因子,专为纠正因忽略不一致分布而导致的预测偏差而设计,并无缝集成到损失函数中。广泛的实验表明,所提出的 Sage 在提升长尾学习中的性能方面效果显著。
引用
@article{arxiv.2507.12807,
title = {Semantic-guided Fine-tuning of Foundation Model for Long-tailed Visual Recognition},
author = {Yufei Peng and Yonggang Zhang and Yiu-ming Cheung},
journal= {arXiv preprint arXiv:2507.12807},
year = {2025}
}