GrabS:一种无需场景监督的3D对象分割生成式本体化智能体
计算机视觉与模式识别
2025-04-17 v1 人工智能
机器学习
机器人学
摘要
我们研究了在不依赖3D场景人工标签监督的情况下进行3D对象分割的困难问题。通过依赖于预训练2D特征或外部信号(如运动)来对3D点进行分组以识别对象,现有无监督方法通常局限于识别简单对象(如汽车),且其分割结果常因缺乏对象性质而性能不佳。本文提出了一种名为GrabS的新型两阶段管道。我们的方法核心思想是首先学习来自对象数据集中从对象数据集中学习生成式和判别式的对象中心化先验,然后设计一种本体化智能体,通过查询这些预训练的生成式先验来学习发现多个对象的能力。在两个真实世界数据集和一个新创建的合成数据集上进行了广泛评估,结果表明我们的方法在分割性能上显著优于所有现有的无监督方法。
引用
@article{arxiv.2504.11754,
title = {GrabS: Generative Embodied Agent for 3D Object Segmentation without Scene Supervision},
author = {Zihui Zhang and Yafei Yang and Hongtao Wen and Bo Yang},
journal= {arXiv preprint arXiv:2504.11754},
year = {2025}
}
备注
ICLR 2025 Spotlight. Code and data are available at: https://github.com/vLAR-group/GrabS