中文

Vote2Cap-DETR++:面向端到端三维密集描述的解耦定位与描述

计算机视觉与模式识别 2023-09-07 v1

摘要

三维密集描述要求模型将对输入三维场景的理解转化为与不同物体区域相关联的若干描述。现有方法采用复杂的“先检测后描述”流程,在带有大量手工设计组件的三维检测器上构建显式关系模块。尽管这些方法已取得初步成功,但由于重复且不准确的边界框估计以及杂乱的三维场景,级联流程容易累积误差。本文首先提出 Vote2Cap-DETR,一种简洁而高效的三维密集描述 transformer 框架,通过并行解码将描述生成与物体定位的解码过程解耦。此外,我们认为物体定位与描述生成需要不同层次的场景理解,这对一组共享的查询而言难以捕捉。为此,我们提出进阶版本 Vote2Cap-DETR++,将查询解耦为定位查询与描述查询以捕获任务特定特征。另外,我们引入迭代空间细化策略对投票查询进行优化,以实现更快收敛与更优定位性能。我们还在描述头中插入额外的空间信息以生成更准确的描述。无需额外技巧,在 ScanRefer 和 Nr3D 两个常用数据集上的大量实验表明,Vote2Cap-DETR 与 Vote2Cap-DETR++ 大幅超越传统的“先检测后描述”方法。代码将发布于 https://github.com/ch3cook-fdu/Vote2Cap-DETR。

关键词

引用

@article{arxiv.2309.02999,
  title  = {Vote2Cap-DETR++: Decoupling Localization and Describing for End-to-End 3D Dense Captioning},
  author = {Sijin Chen and Hongyuan Zhu and Mingsheng Li and Xin Chen and Peng Guo and Yinjie Lei and Gang Yu and Taihao Li and Tao Chen},
  journal= {arXiv preprint arXiv:2309.02999},
  year   = {2023}
}