用于 3D 目标检测的端到端 Transformer 模型
计算机视觉与模式识别
2021-09-17 v1 人工智能
机器学习
摘要
我们提出 3DETR,一种基于端到端 Transformer 的用于 3D 点云的目标检测模型。与采用大量 3D 特定归纳偏置的现有检测方法相比,3DETR 对原始 Transformer 模块仅需极小修改。具体而言,我们发现带有非参数查询和傅里叶位置嵌入的标准 Transformer 可与采用手工调参的 3D 特定算子库的专业化架构相竞争。尽管如此,3DETR 概念简单且易于实现,能够通过融入 3D 领域知识实现进一步改进。通过大量实验,我们表明 3DETR 在具有挑战性的 ScanNetV2 数据集上以 9.5% 的优势优于成熟且高度优化的 VoteNet 基线。此外,我们表明 3DETR 适用于检测之外的 3D 任务,并可作为未来研究的构建模块。
引用
@article{arxiv.2109.08141,
title = {An End-to-End Transformer Model for 3D Object Detection},
author = {Ishan Misra and Rohit Girdhar and Armand Joulin},
journal= {arXiv preprint arXiv:2109.08141},
year = {2021}
}
备注
Accepted at ICCV 2021