中文

DesCLIP:通过通用属性描述实现基于VLM的视觉识别鲁棒持续学习

计算机视觉与模式识别 2026-03-24 v3 人工智能

摘要

视觉-语言模型(VLM)的持续学习侧重于利用跨模态预训练知识,逐步适应不断扩展的下游任务和数据集,同时应对知识遗忘的挑战。现有研究通常侧重于将视觉特征与下游任务中的特定类别文本相连接,忽略了通用知识与专业知识之间的潜在关系。我们的发现表明,强迫模型优化不恰当的视觉-文本匹配会加剧对VLM识别能力的遗忘。为了解决这个问题,我们提出了DesCLIP,它利用通用属性(GA)描述来引导对特定类别对象的理解,使VLM能够建立鲁棒的视觉-GA-类别三边关联,而非仅仅依赖视觉-类别连接。具体来说,我们引入了一个语言助手,通过适当的请求提示生成具体的GA描述候选。然后,设计了一个基于锚点的嵌入过滤器,以获取高度相关的GA描述嵌入,并将其用作视觉-文本实例匹配的配对文本嵌入,从而微调视觉编码器。相应地,类别文本嵌入被逐步校准,以与这些共享的GA描述嵌入对齐。大量实验证明了我们提出方法的先进性和有效性,全面的实证评估突显了其在基于VLM的识别中相较于现有持续学习方法的优越性能。

关键词

引用

@article{arxiv.2502.00618,
  title  = {DesCLIP: Robust Continual Learning via General Attribute Descriptions for VLM-Based Visual Recognition},
  author = {Chiyuan He and Zihuan Qiu and Fanman Meng and Linfeng Xu and Qingbo Wu and Hongliang Li},
  journal= {arXiv preprint arXiv:2502.00618},
  year   = {2026}
}

备注

IEEE Transactions on Multimedia 2026