通过卡尔曼滤波实现 CLIP 模型的贝叶斯自然梯度精调
机器学习
2025-11-04 v1 人工智能
摘要
视觉-语言预训练模型,如 CLIP,已在多模态数据挖掘中树立了新的基准。在此类模型中,few-shot 精调是实现在分布内 (ID) 和分布外 (OOD) 数据集上获得最佳性能的主要挑战,尤其当标注数据稀缺时。大多数现有精调方法依赖基于一阶梯度的优化器,通常会导致收敛缓慢、对步长超参数敏感,并且在 OOD 环境下表现差。相比之下,二阶方法利用损失景观的局部曲率信息来调整更新步长。这对 CLIP 模型尤为有益,因为其非凸损失函数常包含尖锐临界点。在此情况下,自然梯度方向可在稀缺数据下的迭代更新中提供更大的、更有效的贡献。自然梯度下降 (NGD) 通过对标准梯度乘以 Fisher 信息矩阵 (FIM) 的逆矩阵来实现,这在大型模型上计算成本高昂。为此,我们提出一种用于 CLIP 模型的贝叶斯近似 NGD 方法,利用卡尔曼滤波实现。我们的方法将二阶优化的优势与贝叶斯推断相结合,既增强了泛化性,又提供了不确定性量化。针对多样化的图像分类数据集进行的广泛实验表明,我们的方法在 ID 性能方面始终优于或相当于最先进的基准,在 OOD 鲁棒性方面表现出所需改进。据我们了解,这是首次成功将卡尔曼滤波应用于 CLIP 基于模型的精调,使其在视觉-语言任务中实现更稳健、更高效的学习。
关键词
引用
@article{arxiv.2511.01694,
title = {Bayesian Natural Gradient Fine-Tuning of CLIP Models via Kalman Filtering},
author = {Hossein Abdi and Mingfei Sun and Wei Pan},
journal= {arXiv preprint arXiv:2511.01694},
year = {2025}
}