EgoLifter:基于哥元感知的开放世界 3D 语义分割
计算机视觉与模式识别
2024-07-24 v2
摘要
本文提出 EgoLifter,一种 novel 系统,可自动将由哥元传感器捕获的场景分割为单个 3D 对象的完整分解。该系统专为包含大量对象且从自然(非扫描)运动中捕获的场景而设计。EgoLifter 采用 3D 高斯作为 3D 场景和对象的底层表示,并使用 Segment Anything Model (SAM) 的分割掩码作为弱监督,学习灵活且可提示的物体实例定义,无需特定物体分类学。为处理哥元视频中动态对象的挑战,我们设计了一个瞬时预测模块,学习用于在 3D 重建中过滤掉动态对象。结果是一个完全自动的管道,可将 3D 物体实例重构为由 3D 高斯组成的集合,这些集合共同构成整个场景。我们在 Aria Digital Twin 数据集上创建了一个新基准,定量证明了其在自然哥元输入下的开放世界 3D 语义分割中的 SOTA 性能。我们在各种哥元活动数据集上运行 EgoLifter,显示了该方法在规模化 3D 哥元感知方面的潜力。
引用
@article{arxiv.2403.18118,
title = {EgoLifter: Open-world 3D Segmentation for Egocentric Perception},
author = {Qiao Gu and Zhaoyang Lv and Duncan Frost and Simon Green and Julian Straub and Chris Sweeney},
journal= {arXiv preprint arXiv:2403.18118},
year = {2024}
}
备注
ECCV 2024 camera ready version. Project page: https://egolifter.github.io/