中文

Cubify Anything:扩展室内3D目标检测

计算机视觉与模式识别 2024-12-06 v1

摘要

我们考虑从单个RGB(-D)帧中进行室内3D目标检测,后者来自廉价手持设备。我们寻求相对于数据和建模两方面大幅提升。首先,我们确定现有数据集在规模、准确性和目标多样性方面存在显著局限。因此,我们引入了Cubify-Anything 1M (CA-1M) 数据集,对超过400K个3D目标进行详尽标注,涵盖超过1K个高度精确的激光扫描场景,并与超过3.5K个手持、环视捕获的场景实现近乎完美的配准。接下来,我们提出了Cubify Transformer (CuTR),一种完全基于Transformer的3D目标检测基线,不同于在点或体素表示上进行3D操作,CuTR直接从RGB(-D)输入派生的2D特征中预测3D框。虽然该方法缺乏任何3D归纳偏置,但我们展示了在CA-1M配合Paired with CA-1M,CuTR能够超过62%地准确地在3D中召回目标,并且在处理来自廉价LiDAR派生深度图中存在的噪声和不确定性方面具有显著优势,同时也提供了在无结构变化的情况下的有前景的仅RGB性能。此外,通过在CA-1M上预训练,CuTR能够在更多样化的SUN RGB-D变体上超越基于点的模型,支持“虽然在较小数据集规模下,3D归纳偏置有用,但在CA-1M的数据丰富 regime 下则失败”的论点。总体而言,本数据集和基线模型提供了强有力的证据,表明我们正在向能够有效地Cubify Anything的模型迈进。

关键词

引用

@article{arxiv.2412.04458,
  title  = {Cubify Anything: Scaling Indoor 3D Object Detection},
  author = {Justin Lazarow and David Griffiths and Gefen Kohavi and Francisco Crespo and Afshin Dehghan},
  journal= {arXiv preprint arXiv:2412.04458},
  year   = {2024}
}