中文

D3Net:一种用于三维密集描述与视觉定位的统一说话者-听者架构

计算机视觉与模式识别 2022-07-25 v2

摘要

近期关于三维密集描述与视觉定位的研究已取得令人瞩目的成果。尽管这两个领域均有进展,但可用的三维视觉-语言数据量有限,导致三维视觉定位与三维密集描述方法出现过拟合问题。此外,如何在复杂三维环境中区分性地描述物体尚未得到充分研究。为应对这些挑战,我们提出 D3Net,一种端到端的神经说话者-听者架构,能够检测、描述并区分物体。我们的 D3Net 以自批判方式统一了三维密集描述与视觉定位。D3Net 的这种自批判特性还在物体描述生成过程中引入了区分性,并使得在仅有部分标注描述的 ScanNet 数据上进行半监督训练成为可能。我们的方法在 ScanRefer 数据集上的两项任务均优于 SOTA 方法,并以显著优势超越 SOTA 三维密集描述方法。

关键词

引用

@article{arxiv.2112.01551,
  title  = {D3Net: A Unified Speaker-Listener Architecture for 3D Dense Captioning and Visual Grounding},
  author = {Dave Zhenyu Chen and Qirui Wu and Matthias Nießner and Angel X. Chang},
  journal= {arXiv preprint arXiv:2112.01551},
  year   = {2022}
}

备注

Project website: https://daveredrum.github.io/D3Net/