时间反演扩散张量 Transformer:少样本目标检测的新 TENET
计算机视觉与模式识别
2022-11-01 v1 人工智能
机器学习
摘要
本文中,我们解决少样本目标检测这一挑战性问题。现有 FSOD 流程(i)使用平均池化表示导致信息损失;和/或(ii)丢弃可助于检测目标实例的位置信息。因此,此类流程对支持图像与查询图像间较大的类内外观与几何差异敏感。为克服这些缺陷,我们提出时间反演扩散张量 Transformer(TENET),其(i)形成高阶张量表示以捕获高度判别性的多路特征共现,且(ii)使用 Transformer 动态提取查询图像与整个支持集之间的相关性,而非单一平均池化支持嵌入。我们还提出配备高阶表示的 Transformer 关系头(TRH),其编码查询区域与整个支持集间的相关性,同时对目标实例的位置变化敏感。我们的模型在 PASCAL VOC、FSOD 和 COCO 上取得了最先进的结果。
引用
@article{arxiv.2210.16897,
title = {Time-rEversed diffusioN tEnsor Transformer: A new TENET of Few-Shot Object Detection},
author = {Shan Zhang and Naila Murray and Lei Wang and Piotr Koniusz},
journal= {arXiv preprint arXiv:2210.16897},
year = {2022}
}
备注
Accepted at the 17th European Conference on Computer Vision (ECCV 2022)