COSMIC:基于Clique-Oriented语义多空间集成的鲁棒CLIP测试时适应
计算机视觉与模式识别
2025-04-01 v1 人工智能
机器学习
多媒体
摘要
近期视觉语言模型(VLM)在针对新领域进行测试时适应面临重大挑战。虽然基于缓存的方法显示出前景,通过利用历史信息来实现适应,但它们在缓存不可靠的特征-标签对以及在查询时不成比例地使用单类信息方面存在困难,显著损害了适应准确性。为此,我们提出COSMIC(Clique-Oriented Semantic Multi-space Integration for CLIP),是一个鲁棒的测试时适应框架,通过多粒度、跨模态语义缓存和图基查询机制来增强适应性。我们的框架引入了两个关键创新:双语义图(DSG)和基于Clique的超分类(CGH)。双语义图通过纳入文本特征、粗粒度CLIP特征和细粒度DINOv2特征来构建互补语义空间,以捕获丰富的语义关系。基于这些双图,基于Clique的超分类组件利用结构化的类关系,通过相关类选择来增强预测鲁棒性。大量实验表明,COSMIC在多个基准测试中表现卓越,在CLIP RN-50上分别在分布外任务上实现了15.81%的显著提升,在跨域生成任务上实现了5.33%的提升。代码已发布于github.com/hf618/COSMIC。
引用
@article{arxiv.2503.23388,
title = {COSMIC: Clique-Oriented Semantic Multi-space Integration for Robust CLIP Test-Time Adaptation},
author = {Fanding Huang and Jingyan Jiang and Qinting Jiang and Hebei Li and Faisal Nadeem Khan and Zhi Wang},
journal= {arXiv preprint arXiv:2503.23388},
year = {2025}
}
备注
Accepted to CVPR 2025