OpenAnnotate3D:面向多模态三维数据的开放词汇自动标注系统
计算机视觉与模式识别
2023-10-23 v1
摘要
在大数据与大模型时代,面向多模态数据的自动标注功能对自动驾驶与具身AI等真实世界AI驱动应用意义重大。不同于传统闭集标注,开放词汇标注对实现类人认知至关重要。然而,面向多模态三维数据的开放词汇自动标注系统寥寥无几。本文中,我们介绍OpenAnnotate3D,一个开源开放词汇自动标注系统,可自动为视觉与点云数据生成2D掩码、3D掩码及3D包围盒标注。我们的系统集成了大语言模型(LLMs)的思维链能力与视觉-语言模型(VLMs)的跨模态能力。据我们所知,OpenAnnotate3D是开放词汇多模态三维自动标注的先驱工作之一。我们在公开与自研真实世界数据集上开展综合评测,表明相较人工标注,该系统显著提升标注效率,同时提供准确的开放词汇自动标注结果。
引用
@article{arxiv.2310.13398,
title = {OpenAnnotate3D: Open-Vocabulary Auto-Labeling System for Multi-modal 3D Data},
author = {Yijie Zhou and Likun Cai and Xianhui Cheng and Zhongxue Gan and Xiangyang Xue and Wenchao Ding},
journal= {arXiv preprint arXiv:2310.13398},
year = {2023}
}
备注
The source code will be released at https://github.com/Fudan-ProjectTitan/OpenAnnotate3D