语义引导的动态视觉原型细化用于组合零样本学习
计算机视觉与模式识别
2026-02-03 v2
摘要
组合零样本学习(CZSL)旨在通过重新组合从已见组合中学习的原始素材来识别未见的状态-对象对。尽管近期在视觉-语言模型(VLMs)方面取得了进展,但仍存在两个局限性:(i)文本驱动的语义原型在视觉特征空间中判别性较弱;且(ii)未见对的优化被动进行,导致已见偏差。为此,我们提出了Duplex框架,结合双原型学习与动态局部图细化视觉原型。对于每种组合,Duplex通过提示学习维持语义原型,并通过从已见图像中解耦的状态和对象原始材料重组来构建用于未见对的视觉原型。视觉原型通过对小批量局部图的轻量级聚合进行动态更新,这些局部图在训练期间无标签地包含未见组合。这种设计引入了细粒度的视觉证据,同时保持语义结构。它丰富了类别原型,更好地消除了在视觉上distinct但在语义上相似的对,减轻了已见偏差。在MIT-States、UT-Zappos和CGQA上的实验在封闭世界和开放世界设置下实现了竞争性的性能和持久的组合泛化。我们的源代码可在https://github.com/ISPZ/Duplex-CZSL上获取。
引用
@article{arxiv.2501.07114,
title = {Semantically Guided Dynamic Visual Prototype Refinement for Compositional Zero-Shot Learning},
author = {Zhong Peng and Yishi Xu and Gerong Wang and Wenchao Chen and Bo Chen and Jing Zhang and Hongwei Liu},
journal= {arXiv preprint arXiv:2501.07114},
year = {2026}
}
备注
Accepted for publication in Neurocomputing