中文

用于组合零样本学习的视觉代理学习

计算机视觉与模式识别 2025-09-03 v4

摘要

组合零样本学习旨在通过利用从已见组合中获得的知识来识别新出现的属性-对象组合。当前方法通过视觉-语言模型(VLM)将文本原型与视觉特征对齐,但受到两个限制:(1) 模态差异阻碍了对语义相似对的区分,(2) 单模态文本原型缺乏细粒度视觉线索。本文引入视觉代理学习,一种减少模态差异并增强组合泛化性的方法。我们使用文本表示初始化属性、对象及其组合的视觉代理,并优化视觉空间以捕获细粒度线索,从而提高视觉表征。此外,我们提出了跨模态联合学习(CMJL),在文本-图像和细粒度视觉空间之间施加跨模态约束,提高了对未见组合的泛化能力并增强对相似对的区分能力。实验表明,在封闭世界场景下本方法在四个组合零样本学习基准测试中实现了最新性能,在开放世界环境下也表现出竞争力,显示示了该方法在组合泛化方面的有效性。

关键词

引用

@article{arxiv.2501.13859,
  title  = {Learning Visual Proxy for Compositional Zero-Shot Learning},
  author = {Shiyu Zhang and Cheng Yan and Yang Liu and Chenchen Jing and Lei Zhou and Wenjun Wang},
  journal= {arXiv preprint arXiv:2501.13859},
  year   = {2025}
}