WildSeg3D:从二维图像分割野外的任意三维物体
计算机视觉与模式识别
2025-03-18 v2
摘要
从二维图像进行交互式三维分割的最新进展展示了令人瞩目的性能。然而,当前模型通常需要大量的场景特定训练才能准确地重建和分割物体,这限制了它们在实时场景中的适用性。在本文中,我们引入了 WildSeg3D,一种高效的方法,通过前馈机制实现了在多样化环境中对任意三维物体的分割。这种前馈方法的一个关键挑战是在多个二维视图中累积三维对齐误差,这可能导致不准确的三维分割结果。为了解决这个问题,我们提出了动态全局对齐(DGA),一种通过使用动态调整函数聚焦于图像间难以匹配的三维点来提高全局多视图对齐精度的技术。此外,为了实现实时交互式分割,我们引入了多视图组映射(MGM),一种利用物体掩码缓存来整合多视图分割并快速响应用户提示的方法。WildSeg3D 在任意场景中展示了鲁棒的泛化能力,从而消除了对场景特定训练的需求。具体而言,WildSeg3D 不仅达到了最先进的(SOTA)方法的精度,而且相比现有的 SOTA 模型实现了 40 倍的速度提升。我们的代码将公开发布。
引用
@article{arxiv.2503.08407,
title = {WildSeg3D: Segment Any 3D Objects in the Wild from 2D Images},
author = {Yansong Guo and Jie Hu and Yansong Qu and Liujuan Cao},
journal= {arXiv preprint arXiv:2503.08407},
year = {2025}
}