中文

I2DFormer:面向零样本图像分类的图到文档注意力学习

计算机视觉与模式识别 2022-09-22 v1

摘要

尽管零样本学习(ZSL)取得了巨大进展,现有多数方法仍依赖人工标注的属性,这类属性难以标注且难以扩展。一种无监督的替代方案是使用与语义类名关联的词嵌入来表示每个类别。然而,从预训练语言模型提取的词嵌入未必能捕捉视觉相似性,导致零样本性能不佳。本文认为,在线文本文档(如 Wikipedia)包含关于对象类别的丰富视觉描述,因此可用作 ZSL 的强大无监督侧信息。为此,我们提出 I2DFormer,一种基于 transformer 的新型 ZSL 框架,通过在共享嵌入空间中对齐两种模态来联合编码图像与文档。为从含噪文档中提炼具判别性的视觉词,我们引入一种新的跨模态注意力模块,学习图像块与文档词之间的细粒度交互。因此,我们的 I2DFormer 不仅学到捕捉视觉相似性的高判别性文档嵌入,还获得在图像区域中定位视觉相关词的能力。在定量上,我们在三个公开数据集上证明,I2DFormer 在零样本与广义零样本学习设定下均显著优于先前的无监督语义嵌入。在定性上,我们展示该方法可产生高度可解释的结果,其中文档词可锚定到图像区域。

关键词

引用

@article{arxiv.2209.10304,
  title  = {I2DFormer: Learning Image to Document Attention for Zero-Shot Image Classification},
  author = {Muhammad Ferjad Naeem and Yongqin Xian and Luc Van Gool and Federico Tombari},
  journal= {arXiv preprint arXiv:2209.10304},
  year   = {2022}
}

备注

36th Conference on Neural Information Processing Systems (NeurIPS 2022)