MSCI:解决CLIP内在局限性用于组合零样学习
计算机视觉与模式识别
2025-05-16 v1
摘要
组合零样学习(CZSL)旨在通过利用已知组合来识别未见的状态-对象组合。现有研究基本依赖CLIP的跨模态对齐能力,但往往忽视其在捕获细粒度局部特征方面的局限性,这些局限性源于其体系结构和训练范式。为解决这一问题,我们提出一种多阶段跨模态交互(MSCI)模型,有效地探索和利用CLIP视觉编码器中中间层的信息。具体而言,我们设计了两个自适应聚合器,分别从低级视觉特征中提取局部信息和从高级视觉特征中整合全局信息。这两类关键信息通过阶段化的交互机制逐步融入文本表示中,显著增强了模型对细粒度局部视觉信息的感知能力。此外,MSCI能够根据不同组合以及同一组合中的不同元素,动态调整全局与局部视觉信息之间的注意力权重,使其能够灵活适应多样化的场景。在三个广泛使用的数据集上进行实验,充分验证了所提出模型的有效性和优越性。数据和代码均已公开于 https://github.com/ltpwy/MSCI。
引用
@article{arxiv.2505.10289,
title = {MSCI: Addressing CLIP's Inherent Limitations for Compositional Zero-Shot Learning},
author = {Yue Wang and Shuai Xu and Xuelin Zhu and Yicong Li},
journal= {arXiv preprint arXiv:2505.10289},
year = {2025}
}
备注
9 pages, 5 figures