中文

时间反演扩散张量 Transformer:少样本目标检测的新 TENET

计算机视觉与模式识别 2022-11-01 v1 人工智能 机器学习

摘要

本文中,我们解决少样本目标检测这一挑战性问题。现有 FSOD 流程(i)使用平均池化表示导致信息损失;和/或(ii)丢弃可助于检测目标实例的位置信息。因此,此类流程对支持图像与查询图像间较大的类内外观与几何差异敏感。为克服这些缺陷,我们提出时间反演扩散张量 Transformer(TENET),其(i)形成高阶张量表示以捕获高度判别性的多路特征共现,且(ii)使用 Transformer 动态提取查询图像与整个支持集之间的相关性,而非单一平均池化支持嵌入。我们还提出配备高阶表示的 Transformer 关系头(TRH),其编码查询区域与整个支持集间的相关性,同时对目标实例的位置变化敏感。我们的模型在 PASCAL VOC、FSOD 和 COCO 上取得了最先进的结果。

关键词

引用

@article{arxiv.2210.16897,
  title  = {Time-rEversed diffusioN tEnsor Transformer: A new TENET of Few-Shot Object Detection},
  author = {Shan Zhang and Naila Murray and Lei Wang and Piotr Koniusz},
  journal= {arXiv preprint arXiv:2210.16897},
  year   = {2022}
}

备注

Accepted at the 17th European Conference on Computer Vision (ECCV 2022)