CP-DETR:面向更强通用目标检测的概念提示引导DETR
计算机视觉与模式识别
2024-12-16 v1 人工智能
摘要
近期研究旨在引入语言于SoTA闭合集检测器中,然后通过构建大规模(文本-区域)数据集来泛化开放集概念。然而,这些方法面临两个主要挑战:(i)如何有效利用提示中的先验信息以通用化对象,(ii)如何减少下游任务中的对齐偏差,均导致在预训练之外的某些场景下性能次优。为此,我们提出了一种强大的通用检测基础模型CP-DETR,该模型在几乎所有场景中都表现出竞争力,且仅需一个预训练权重。具体来说,我们设计了一种高效的提示视觉混合编码器,通过尺度-尺度和多尺度融合模块增强提示与视觉信息之间的交互。随后,该混合编码器通过提示多标签损失和辅助检测头充分利用提示信息。除文本提示外,我们设计了两种实用的概念提示生成方法——视觉提示和优化提示——通过具体的视觉示例提取抽象概念,并稳定地减少下游任务中的对齐偏差。凭借这些有效的设计,CP-DETR在广泛的场景中展现出优异的通用检测性能。例如,我们的Swin-T背书模型在LVIS上实现了47.6的零样AP,Swin-L背书模型在ODinW35上实现了32.2的零样AP。此外,我们的视觉提示生成方法在COCO验证集上实现了68.4的AP,优化提示在ODinW13上实现了73.1的全监督AP。
引用
@article{arxiv.2412.09799,
title = {CP-DETR: Concept Prompt Guide DETR Toward Stronger Universal Object Detection},
author = {Qibo Chen and Weizhong Jin and Jianyue Ge and Mengdi Liu and Yuchao Yan and Jian Jiang and Li Yu and Xuanjiang Guo and Shuchang Li and Jianzhong Chen},
journal= {arXiv preprint arXiv:2412.09799},
year = {2024}
}
备注
Accepted by AAAI2025