ZeroDiff++: 零样本学习中大量未见视觉语义关联
计算机视觉与模式识别
2026-02-16 v1
摘要
零样本学习 (ZSL) 通过生成式双阶段方法使分类器能够识别训练期间未见的类别:(1) 从已见类别学习视觉语义关联;(2) 从语义合成未见类别特征以训练分类器。在本文中,我们识别了现有生成式 ZSL 方法中存在的伪虚视觉语义关联,这些关联因已见类别样本稀缺而受到影响,并提出两种度量标准来量化已见和未见类别的伪虚性。进一步地,我们指出更关键的瓶颈:现有的不可适应的全噪声生成器产生的特征与真实测试样本脱节,导致伪虚关联。为增强已见和未见类别上的视觉语义关联,我们提出了 ZeroDiff++,一种基于扩散的生成式框架。在训练期间,ZeroDiff++ 使用 (i) 扩散数据增强以产生多样化噪声样本,(ii) 监督对比 (SC) 表示用于实例级语义,以及 (iii) 多视觉判别器结合 Wasserstein 相互学习以评估生成特征。在生成阶段,我们引入 (iv) 基于扩散的测试时适应 (DiffTTA) 以用于伪标签重建的生成器适应,以及 (v) 基于扩散的测试时生成 (DiffGen) 以追踪扩散去噪路径并产生部分合成特征,连接真实与生成数据,进一步缓解数据稀缺问题。在三个 ZSL 基准测试上进行大量实验表明,ZeroDiff++ 不仅在现有 ZSL 方法上实现了显著提升,还即使在稀缺训练数据下表现也稳健。代码将提供。
引用
@article{arxiv.2602.12401,
title = {ZeroDiff++: Substantial Unseen Visual-semantic Correlation in Zero-shot Learning},
author = {Zihan Ye and Shreyank N Gowda and Kaile Du and Weijian Luo and Ling Shao},
journal= {arXiv preprint arXiv:2602.12401},
year = {2026}
}
备注
Under review