DECO:释放 ConvNets 在基于查询的检测与分割中的潜力
摘要
Transformer 及其变体近年来在各种视觉任务中展现出巨大潜力,包括图像分类、目标检测和分割。同时,最近的研究也表明,通过适当的架构设计,卷积网络(ConvNets)也能取得与 Transformer 相媲美的性能。然而,此前尚无方法探索利用纯卷积构建 Transformer 风格的 Decoder 模块,而这对于像 Detection Transformer (DETR) 这样的 Encoder-Decoder 架构至关重要。为此,本文探讨了是否可以用 ConvNets 而非复杂的 Transformer 架构来构建基于查询的检测和分割框架。我们提出了一种名为 InterConv 的新机制,通过卷积层执行对象查询与图像特征之间的交互。配备所提出的 InterConv 后,我们构建了 Detection ConvNet (DECO),其由骨干网络和卷积 Encoder-Decoder 架构组成。我们在具有挑战性的 COCO 基准上将提出的 DECO 与先前的检测器进行了比较。尽管结构简单,我们的 DECO 在检测精度和运行速度方面均取得了具有竞争力的性能。具体而言,使用 ResNet-18 和 ResNet-50 骨干网络时,我们的 DECO 分别以 和 FPS 的速度实现了 和 的 AP。所提出的方法也在“分割一切”(segment anything)任务上进行了评估,显示出相似的性能和更高的效率。我们希望所提出的方法能为视觉任务的架构设计带来新的视角。代码可在 https://github.com/xinghaochen/DECO 和 https://github.com/mindspore-lab/models/tree/master/research/huawei-noah/DECO 获取。
引用
@article{arxiv.2312.13735,
title = {DECO: Unleashing the Potential of ConvNets for Query-based Detection and Segmentation},
author = {Xinghao Chen and Siwei Li and Yijing Yang and Yunhe Wang},
journal= {arXiv preprint arXiv:2312.13735},
year = {2025}
}
备注
ICLR 2025