SEER-ZSL:面向广义零样本学习的语义编码器增强表示
计算机视觉与模式识别
2025-06-10 v2
摘要
零样本学习(ZSL)面临识别训练期间未见类别的挑战。该任务在收集训练数据成本高昂、被禁止或不可行的领域至关重要。ZSL 依赖视觉空间与可用语义信息间的映射。先前工作学习可在推理时利用的空间间映射。然而,精心策划的语义空间与真实世界数据固有噪声之间的差异仍是重大且未解决的挑战。本文通过引入面向零样本学习的语义编码器增强表示(SEER-ZSL)解决此问题。提出混合策略以解决泛化差距。首先,使用概率编码器蒸馏有意义的语义信息,增强语义一致性和鲁棒性。其次,通过对抗训练生成器利用学习到的数据分布蒸馏视觉空间。最后,对齐蒸馏信息,实现未见类别到真实数据流形的映射。实证表明,该方法在小型、中型和大型数据集的多种设置下,泛化性能和基准测试均优于 SOTA 基准。完整代码可在 GitHub 获取。
引用
@article{arxiv.2312.13100,
title = {SEER-ZSL: Semantic Encoder-Enhanced Representations for Generalized Zero-Shot Learning},
author = {William Heyden and Habib Ullah and M. Salman Siddiqui and Fadi Al Machot},
journal= {arXiv preprint arXiv:2312.13100},
year = {2025}
}