高效解耦 CLIP 以实现多目标感知
计算机视觉与模式识别
2025-09-26 v4
摘要
像 CLIP 这样的视觉-语言模型擅长识别场景中单个突出的物体。然而,它们在包含多个物体的复杂场景中表现不佳。我们发现了这一局限性的一个根本原因:VLM 特征空间表现出过多的互特征信息(MFI),即一个类别的特征包含大量关于其他不相关类别的信息。这种高 MFI 在特定类别查询时变得明显,因为不相关的物体与查询类别一起被激活。为了解决这一局限性,我们提出了 DCLIP,这是一个高效的框架,它学习一个最优的互信息水平,同时仅向冻结的 VLM 添加极少的可学习参数。DCLIP 使用两个互补的损失函数:一个新颖的 MFI 损失,用于调节类别特征相似性,以防止过度重叠同时保留必要的共享信息;以及非对称损失(ASL),用于将图像特征与解耦的文本特征对齐。通过这种解耦,DCLIP 将过度的类间相似性降低了 30%。在多标签识别任务上,DCLIP 在 VOC2007 和 COCO-14 数据集上的表现优于 SOTA 方法,同时使用的训练参数减少了 75%。对于零样本语义分割,它在六个基准数据集上均显示出性能提升。这些结果突显了特征解耦对于 VLM 中多目标感知的重要性。
引用
@article{arxiv.2502.02977,
title = {Efficiently Disentangling CLIP for Multi-Object Perception},
author = {Samyak Rawlekar and Yujun Cai and Yiwei Wang and Ming-Hsuan Yang and Narendra Ahuja},
journal= {arXiv preprint arXiv:2502.02977},
year = {2025}
}