中文

在 Transformer 中学习跨图像对象语义关系以用于少样本细粒度图像分类

计算机视觉与模式识别 2022-07-05 v1

摘要

少样本细粒度学习旨在将查询图像分类为具有细粒度差异的若干支持类别之一。尽管通过深度神经网络学习不同对象的局部差异已取得成效,但在少样本细粒度场景下,如何在基于 Transformer 的架构中利用查询-支持跨图像对象语义关系仍鲜有探索。本工作中,我们提出一种基于 Transformer 的双螺旋模型,即 HelixFormer,以双向对称方式实现跨图像对象语义关系挖掘。HelixFormer 包含两步:1)跨分支的关系挖掘过程(RMP);2)各分支内的表示增强过程(REP)。通过所设计的 RMP,每个分支可利用另一分支的信息提取细粒度对象级跨图像语义关系图(CSRMs),确保在语义相关局部对象区域间更好的跨图像交互。进一步,借助 CSRMs,所开发的 REP 可增强各分支中已发现语义相关局部区域的特征提取,提升模型区分细粒度对象细微特征差异的能力。在五个公开细粒度基准上的大量实验表明,HelixFormer 能有效增强用于识别细粒度对象的跨图像对象语义关系匹配,在 1-shot 与 5-shot 场景下均大幅优于多数最先进方法。我们的代码见:https://github.com/JiakangYuan/HelixFormer

关键词

引用

@article{arxiv.2207.00784,
  title  = {Learning Cross-Image Object Semantic Relation in Transformer for Few-Shot Fine-Grained Image Classification},
  author = {Bo Zhang and Jiakang Yuan and Baopu Li and Tao Chen and Jiayuan Fan and Botian Shi},
  journal= {arXiv preprint arXiv:2207.00784},
  year   = {2022}
}

备注

Accepted by ACM MM-2022