ReHARK:面向单样本视觉语言适应的精炼混合自适应 RBF 核
计算机视觉与模式识别
2026-03-13 v1 人工智能
摘要
大规模视觉语言模型(VLM)如 CLIP 适应下游任务时,尤其是在单样本情境下,常面临显著的“稳定性-塑性”困境。虽然训练自由的方法如 Tip-Adapter 引入了高效的缓存机制,但这些方法常作为局部 Nadaraya-Watson 估计器工作,具有固有的边界偏差和缺乏全局结构正则化。本文提出 ReHARK(精炼混合自适应 RBF 核),作为一种通过再现核希尔伯特空间(RKHS)中的全局近端正则化来重新解释少样本适应的训练自由框架。引入多阶段精炼管线,包括:(1)混合先验构建,通过融合 CLIP 和 GPT-3 的零样本文本知识与视觉类原型,形成稳健的语义-视觉锚点;(2)支持集增强(桥接),生成中间样本以平滑视觉与文本模态之间的转换;(3)自适应分布校正,通过对齐测试特征统计与增强后的支持集来缓解领域偏移;(4)多尺度 RBF 核,采用核函数组合以捕获不同尺度上的复杂特征几何。在 11 个多样化基准测试上,我们在稳定性和准确性方面均取得优异成绩。ReHARK 建立了单样本适应的新型最先进水平,平均准确率达65.83%,显著优于现有基线。代码已公开于 https://github.com/Jahid12012021/ReHARK。
引用
@article{arxiv.2603.11542,
title = {ReHARK: Refined Hybrid Adaptive RBF Kernels for Robust One-Shot Vision-Language Adaptation},
author = {Md Jahidul Islam},
journal= {arXiv preprint arXiv:2603.11542},
year = {2026}
}