中文

CREST:基于证据深度学习的跨模态共振以增强零样本学习

计算机视觉与模式识别 2024-07-24 v4

摘要

零样本学习(ZSL)通过利用从已知类别到未知类别的语义知识转移,实现了对新颖类别的识别。这些知识通常封装在属性描述中,有助于识别特定类别的视觉特征,从而促进视觉-语义对齐并提升 ZSL 性能。然而,现实世界中的挑战(如实例间的分布不平衡与属性共现)常常阻碍对图像局部差异的辨识,而细粒度、特定区域属性标注的稀缺性进一步加剧了这一问题。此外,类别内视觉呈现的变异性也可能导致属性与类别关联的偏移。为此,我们提出了一种双向跨模态 ZSL 方法 CREST。它首先提取属性与视觉定位的表示,并采用证据深度学习(EDL)来度量潜在的认知不确定性,从而增强模型对困难负样本的抵御能力。CREST 融合了专注于视觉-类别与属性-类别对齐的双重学习路径,以确保潜在空间与可观测空间之间稳健的关联。此外,我们引入了一种不确定性感知的跨模态融合技术,以优化视觉-属性推断。大量实验证明了我们的模型在多个数据集上的有效性与独特的可解释性。我们的代码和数据可在以下网址获取:https://github.com/JethroJames/CREST

关键词

引用

@article{arxiv.2404.09640,
  title  = {CREST: Cross-modal Resonance through Evidential Deep Learning for Enhanced Zero-Shot Learning},
  author = {Haojian Huang and Xiaozhen Qiao and Zhuo Chen and Haodong Chen and Bingyu Li and Zhe Sun and Mulin Chen and Xuelong Li},
  journal= {arXiv preprint arXiv:2404.09640},
  year   = {2024}
}

备注

Accepted by ACM MM 2024; 10 pages, 2 Tables, 9 Figures; Repo is available at: https://github.com/JethroJames/CREST