Epsilon:探索面向多标签零样本学习的全面视觉-语义投影
计算机视觉与模式识别
2024-08-27 v2
摘要
本文研究了多标签场景下零样本学习(MLZSL)这一具有挑战性的问题,其中模型需要基于已见类别和辅助知识(例如语义信息)来识别样本(如图像)中的多个未见类别。现有方法通常从空间或语义特征维度分析样本中存在的各种已见类别的关系,并将学习到的模型迁移到未见类别。然而,它们忽略了局部和全局特征的完整性。虽然使用注意力结构可以精确定位局部特征(尤其是物体),但会显著损失其完整性,并且类别间的关系也会受到影响。对全局特征的粗略处理也会直接影响全面性。这种忽略会使模型失去对图像主要成分的把握。在推理阶段仅依赖已见类别的局部存在会引入不可避免的偏差。在本文中,我们为MLZSL提出了一种新颖且全面的视觉-语义框架,称为Epsilon,以充分利用这些特性,实现更准确、更鲁棒的视觉-语义投影。在空间信息方面,我们通过将图像特征分组聚合到几个语义提示中来实现有效的细化。这可以聚合语义信息而非类别信息,从而保留语义之间的相关性。在全局语义方面,我们使用全局前向传播来收集尽可能多的信息,以确保语义不被遗漏。在大型MLZSL基准数据集NUS-Wide和Open-Images-v4上的实验表明,所提出的Epsilon以较大优势优于其他最先进的方法。
引用
@article{arxiv.2408.12253,
title = {Epsilon: Exploring Comprehensive Visual-Semantic Projection for Multi-Label Zero-Shot Learning},
author = {Ziming Liu and Jingcai Guo and Song Guo and Xiaocheng Lu},
journal= {arXiv preprint arXiv:2408.12253},
year = {2024}
}
备注
11 pages, 6 figures. arXiv admin note: substantial text overlap with arXiv:2309.00923