CoDA:面向开放词汇三维目标检测的协同式新物体框发现与跨模态对齐
计算机视觉与模式识别
2023-10-05 v1
摘要
开放词汇三维目标检测(OV-3DDet)旨在从三维场景中任意类别列表中检测物体,文献中对此仍鲜有探索。OV-3DDet中存在两个基本问题,即新物体的定位与分类。本文旨在有限基类别条件下,通过统一框架同时解决这两个问题。为定位新三维物体,我们提出一种有效的三维新物体发现策略,利用三维框几何先验与二维语义开放词汇先验生成新物体的伪框标签。为分类新物体框,我们进一步基于已发现的新物体框开发跨模态对齐模块,以对齐三维点云与图像/文本模态间的特征空间。具体而言,对齐过程包含类不可知与类可判别对齐,不仅纳入带标注的基物体,也纳入不断发现的新物体,从而实现迭代增强的对齐。新物体发现与跨模态对齐联合学习以协同互利:新物体发现直接影响跨模态对齐,而更好的特征对齐又可反过来提升定位能力,从而形成统一的OV-3DDet框架CoDA,用于同步的新物体定位与分类。在两个具挑战性数据集(即SUN-RGBD与ScanNet)上的大量实验证明了方法的有效性,并显示出相较最佳替代方法的mAP显著提升达80%。代码与预训练模型已在项目页面发布。
关键词
引用
@article{arxiv.2310.02960,
title = {CoDA: Collaborative Novel Box Discovery and Cross-modal Alignment for Open-vocabulary 3D Object Detection},
author = {Yang Cao and Yihan Zeng and Hang Xu and Dan Xu},
journal= {arXiv preprint arXiv:2310.02960},
year = {2023}
}
备注
Accepted by NeurIPS 2023. Project Page: https://yangcaoai.github.io/publications/CoDA.html