中文

OpenAnnotate3D:面向多模态三维数据的开放词汇自动标注系统

计算机视觉与模式识别 2023-10-23 v1

摘要

在大数据与大模型时代,面向多模态数据的自动标注功能对自动驾驶与具身AI等真实世界AI驱动应用意义重大。不同于传统闭集标注,开放词汇标注对实现类人认知至关重要。然而,面向多模态三维数据的开放词汇自动标注系统寥寥无几。本文中,我们介绍OpenAnnotate3D,一个开源开放词汇自动标注系统,可自动为视觉与点云数据生成2D掩码、3D掩码及3D包围盒标注。我们的系统集成了大语言模型(LLMs)的思维链能力与视觉-语言模型(VLMs)的跨模态能力。据我们所知,OpenAnnotate3D是开放词汇多模态三维自动标注的先驱工作之一。我们在公开与自研真实世界数据集上开展综合评测,表明相较人工标注,该系统显著提升标注效率,同时提供准确的开放词汇自动标注结果。

关键词

引用

@article{arxiv.2310.13398,
  title  = {OpenAnnotate3D: Open-Vocabulary Auto-Labeling System for Multi-modal 3D Data},
  author = {Yijie Zhou and Likun Cai and Xianhui Cheng and Zhongxue Gan and Xiangyang Xue and Wenchao Ding},
  journal= {arXiv preprint arXiv:2310.13398},
  year   = {2023}
}

备注

The source code will be released at https://github.com/Fudan-ProjectTitan/OpenAnnotate3D