基于全交叉 Transformer 的小样本目标检测
计算机视觉与模式识别
2022-09-30 v2 人工智能
多媒体
摘要
小样本目标检测(FSOD)旨在利用极少训练样本检测新物体,近来引起了学界极大研究兴趣。基于度量学习的方法采用基于双分支的孪生网络被证明对该任务有效,并计算图像区域与少样本示例间的相似度以进行检测。然而,在以往工作中,两分支间的交互仅局限于检测头,而其余数百层仍用于独立特征提取。受近期视觉 Transformer 与视觉-语言 Transformer 工作的启发,我们提出一种用于 FSOD 的基于全交叉 Transformer 的新模型(FCT),将交叉 Transformer 同时引入特征骨干与检测头。提出非对称批交叉注意力,以聚合来自不同批大小两分支的关键信息。我们的模型通过引入多级交互,改善了两分支间的小样本相似度学习。在 PASCAL VOC 与 MSCOCO FSOD 基准上的充分实验证明了模型的有效性。
引用
@article{arxiv.2203.15021,
title = {Few-Shot Object Detection with Fully Cross-Transformer},
author = {Guangxing Han and Jiawei Ma and Shiyuan Huang and Long Chen and Shih-Fu Chang},
journal= {arXiv preprint arXiv:2203.15021},
year = {2022}
}
备注
CVPR 2022 (Oral). Code is available at https://github.com/GuangxingHan/FCT