ARKit LabelMaker:面向室内 3D 场景理解的新尺度
计算机视觉与模式识别
2025-03-21 v2 人工智能
摘要
神经网络性能随模型大小和数据量而增长,正如在语言和图像处理中所示。这需要规模友好的架构和大型数据集。虽然 transformer 已被适用于 3D 视觉,但仍缺乏 'GPT 时刻',因训练数据有限。我们引入 ARKit LabelMaker,一个大规模真实世界 3D 数据集,拥有密集语义标注,规模是以往最大数据集的三倍以上。具体而言,我们扩展 ARKitScenes,使用扩展 LabelMaker 流水线自动生成密集 3D 标签,专为大规模预训练而设计。使用本数据集训练可在 ScanNet 和 ScanNet200 上实现 3D 语义分割的最新得分,其中在尾部类别上取得显著提升。我们的代码已发布于 https://labelmaker.org,数据集发布于 https://huggingface.co/datasets/labelmaker/arkit_labelmaker。
引用
@article{arxiv.2410.13924,
title = {ARKit LabelMaker: A New Scale for Indoor 3D Scene Understanding},
author = {Guangda Ji and Silvan Weder and Francis Engelmann and Marc Pollefeys and Hermann Blum},
journal= {arXiv preprint arXiv:2410.13924},
year = {2025}
}