TOMCAT:用于组合零样学习的测试时综合知识累积
计算机视觉与模式识别
2025-12-23 v2
摘要
组合零样学习(CZSL)旨在基于从已见样本中学习到的知识识别新出现的属性-对象组合。现有方法因测试时标签空间分布偏移导致性能下降,这种偏移源于未见组合(由属性和对象重新组合而成)的包含。为克服这一挑战,我们提出了一种新方法,即在文本和视觉两个模态中从无监督数据累积全面知识,以更新多模态原型。在此基础上,我们进一步设计了自适应更新权重,以控制原型调整的程度,使模型能够灵活适应测试期间的分布偏移。此外,引入动态优先队列存储高置信度图像,以获取历史图像的视觉知识用于推理。考虑到多模态知识的语义一致性,我们通过多模态协作表示学习对齐文本和视觉原型。大量实验表明,我们的方法在四个基准数据集上的闭世界和开放世界设置下均实现了最先进的性能。代码将在 https://github.com/xud-yan/TOMCAT 提供。
引用
@article{arxiv.2510.20162,
title = {TOMCAT: Test-time Comprehensive Knowledge Accumulation for Compositional Zero-Shot Learning},
author = {Xudong Yan and Songhe Feng},
journal= {arXiv preprint arXiv:2510.20162},
year = {2025}
}
备注
Accepted to NeurIPS 2025