Gaga:通过3D感知记忆库对任意高斯进行分组
计算机视觉与模式识别
2026-05-29 v4
摘要
我们引入了 Gaga,这是一个利用零样本类别无关分割模型预测的不一致 2D 掩码来重建和分割开放世界 3D 场景的框架。与依赖视频目标跟踪或对比学习方法的先前 3D 场景分割方法不同,Gaga 利用空间信息,并通过一种新颖的 3D 感知记忆库有效地将不同相机位姿下的物体掩码关联起来。通过消除训练图像中视角连续变化的假设,Gaga 展现出了对相机位姿变化的鲁棒性,这对于稀疏采样的图像尤为有益,从而确保了精确的掩码标签一致性。此外,Gaga 能够容纳来自不同来源的 2D 分割掩码,并在不同的开放世界零样本类别无关分割模型上表现出稳健的性能,显著增强了其多功能性。广泛的定性和定量评估表明,Gaga 的表现优于最先进的方法,突显了其在 3D 场景理解和操作等真实世界应用中的潜力。
引用
@article{arxiv.2404.07977,
title = {Gaga: Group Any Gaussians via 3D-aware Memory Bank},
author = {Weijie Lyu and Xueting Li and Abhijit Kundu and Yi-Hsuan Tsai and Ming-Hsuan Yang},
journal= {arXiv preprint arXiv:2404.07977},
year = {2026}
}
备注
TMLR Camera-Ready Version. Project Page: https://weijielyu.github.io/Gaga