面向含歧义标签的零样本学习的动态视觉-语义对齐
计算机视觉与模式识别
2026-04-21 v1
摘要
零样本学习 (ZSL) 旨在在没有视觉实例的情况下识别未见类别。然而,现有方法通常假设标签干净,忽视了现实世界标签噪声和歧义性,导致性能下降。为弥合这一差距,我们提出了动态视觉-语义对齐 (DVSA),一个用于从含歧义标签中学习的鲁棒 ZSL 框架。DVSA 使用带注意力机制的双向视觉-语义对齐模块来相互校准视觉特征和属性原型,并基于相互信息 (MI) 在属性层面上进行对比优化,以增强判别性、语义一致的属性。此外,一个动态标签歧义消解机制不断纠正带有噪声的监督信息,同时保持语义一致性,缩小实例-标签差距并提升泛化能力。大量实验在标准基准上验证表明,DVSA 在含有歧义监督的情况下实现了更强的性能。
引用
@article{arxiv.2604.17710,
title = {Dynamic Visual-semantic Alignment for Zero-shot Learning with Ambiguous Labels},
author = {Jiangnan Li and Linqing Huang and Xiaowen Yan and Min Gan and Wenpeng Lu and Jinfu Fan},
journal= {arXiv preprint arXiv:2604.17710},
year = {2026}
}
备注
Accepted by ICME 2026 (IEEE International Conference on Multimedia and Expo)