中文

基于 Vote2Cap-DETR 的端到端三维密集描述

计算机视觉与模式识别 2023-01-09 v1

摘要

三维密集描述旨在生成多个与其关联物体区域定位相对应的描述文本。现有方法遵循复杂的“先检测后描述”流程,并配备大量手工设计组件。然而,鉴于不同场景间物体空间与类别分布杂乱,这些手工设计组件会导致次优性能。本文提出一种基于近期流行的检测 transformer(DETR)的简洁而高效的 transformer 框架 Vote2Cap-DETR。相较于先前方法,我们的框架具有若干突出优势:1) 无需借助大量手工设计组件,我们的方法基于全 transformer 编码器-解码器架构,带有可学习的投票查询驱动的物体解码器,以及以集合预测方式生成密集描述的解码器。2) 与两阶段方案不同,我们的方法可在一阶段内完成检测与描述。3) 无需额外技巧,在 ScanRefer 和 Nr3D 两个常用数据集上的大量实验表明,我们的 Vote2Cap-DETR 在 [email protected] 指标上分别超越当前最优方法 11.13% 和 7.11%。代码将很快发布。

关键词

引用

@article{arxiv.2301.02508,
  title  = {End-to-End 3D Dense Captioning with Vote2Cap-DETR},
  author = {Sijin Chen and Hongyuan Zhu and Xin Chen and Yinjie Lei and Tao Chen and Gang YU},
  journal= {arXiv preprint arXiv:2301.02508},
  year   = {2023}
}