Box-DETR:理解与框定条件空间查询
计算机视觉与模式识别
2023-07-18 v1
摘要
条件空间查询近期被引入到 DEtection TRansformer (DETR) 中以加速收敛。在 DAB-DETR 中,此类查询在每个解码器阶段由所谓的条件线性投影进行调制,旨在搜索感兴趣的位置,例如边界框的四个端点。每个解码器阶段通过预测锚框偏移来逐步更新边界框,而在交叉注意力中仅将框中心作为参考点告知。然而,仅使用框中心使得当前阶段无法获知前一框的宽度和高度,从而阻碍了偏移的准确预测。我们认为在交叉注意力中显式利用整个框信息至关重要。在本工作中,我们提出 Box Agent 将边界框压缩为头特定的代理点。通过用代理点替代框中心作为每个头中的参考点,条件交叉注意力可以从更合理的起点(考虑前一框的全部范围,而非始终从前一框中心)搜索位置。这显著减轻了条件线性投影的负担。实验结果表明,该框代理不仅带来更快的收敛,还提升了检测性能,例如我们的单尺度模型基于 DAB-DETR 和 ResNet-50 取得了 AP。我们的 Box Agent 仅需对代码做微小修改,且计算开销可忽略。代码见 https://github.com/tiny-smart/box-detr。
引用
@article{arxiv.2307.08353,
title = {Box-DETR: Understanding and Boxing Conditional Spatial Queries},
author = {Wenze Liu and Hao Lu and Yuliang Liu and Zhiguo Cao},
journal= {arXiv preprint arXiv:2307.08353},
year = {2023}
}
备注
11 pages