图引导的跨组合特征解耦用于组合零样本学习
计算机视觉与模式识别
2025-06-02 v2
摘要
原始视觉特征(即属性和对象)的解耦在组合零样本学习(CZSL)中已展现出卓越的效果。然而,由于属性(相应地,对象)与不同对象(相应地,属性)组合时的特征发散,学习在不同组合中通用的解耦原始特征具有挑战性。为此,我们提出跨组合特征解耦方案,该方案以多个共享原始元素的组合作为输入,并约束解耦的原始特征在这些组合中具有通用性。更具体地说,我们利用组合图来定义组合之间的整体原始元素共享关系,并在近期成功的大型预训练视觉语言模型(VLM)CLIP之上构建任务特定的架构,将双跨组合解耦适配器(分别称为L-Adapter和V-Adapter)插入CLIP的冻结文本编码器和图像编码器中。在三个流行的CZSL基准上的评估表明,我们提出的方案显著提升了CZSL的性能,其组件已通过扎实的消融实验得到验证。我们的代码和数据可在以下网址获取:https://github.com/zhurunkai/DCDA。
引用
@article{arxiv.2408.09786,
title = {Graph-guided Cross-composition Feature Disentanglement for Compositional Zero-shot Learning},
author = {Yuxia Geng and Runkai Zhu and Jiaoyan Chen and Jintai Chen and Xiang Chen and Zhuo Chen and Shuofei Qiao and Yuxiang Wang and Xiaoliang Xu and Sheng-Jun Huang},
journal= {arXiv preprint arXiv:2408.09786},
year = {2025}
}
备注
Accepted in ACL 2025 findings