通过语义几何保持进行视觉语言模型的持续学习
计算机视觉与模式识别
2026-03-24 v2 机器学习
摘要
视觉语言模型(VLM)的持续学习容易发生灾难性遗忘,而当前方法在未明确保留继承自预训练和前序阶段的跨模态语义几何结构的情况下适应新任务,使新任务监督可导致几何扭曲。我们观察到,最显著的漂移倾向于集中在靠近旧新语义界面处的脆弱邻域,处于该区域,共享视觉模式很容易被新的文本语义重新解释。为解决此问题在无样本约束条件下,我们提出了语义几何保持持续学习(SeGP-CL)。SeGP-CL 首先通过构建一组对抗锚点(使用双目标投射梯度下降,DPGD)来探测易漂移区域,该方法驱动所选新任务种子趋向旧类语义,同时在原始视觉空间中保持忠实。训练期间,我们通过锚点引导的跨模态几何蒸馏(ACGD)保持跨模态结构,并通过轻量级文本语义几何正则化(TSGR)稳定文本参考框架。训练后,我们估计锚点引起的原始空间漂移以 transfer old visual prototypes 并通过融合跨模态和视觉线索进行双路径推理。广泛的实验表明,SeGP-CL 在五个持续学习基准测试上 consistently 提高了稳定性和前向迁移,实现了在更好地保持 VLM 语义几何的同时实现了状态-of-the-art 性能。
引用
@article{arxiv.2603.12055,
title = {Continual Learning with Vision-Language Models via Semantic-Geometry Preservation},
author = {Chiyuan He and Zihuan Qiu and Fanman Meng and Runtong Zhang and Linfeng Xu and Qingbo Wu and Hongliang Li},
journal= {arXiv preprint arXiv:2603.12055},
year = {2026}
}
备注
14 pages, 11 figures, under review