DivAS:基于深度加权体素聚合的 NeRF 交互式 3D 分割
计算机视觉与模式识别
2026-01-09 v1
摘要
现有的神经辐射场分割方法通常基于优化,需要缓慢的逐场景训练,这牺牲了 2D 基础模型的零样本能力。我们提出了 DivAS(深度交互体素聚合分割,Depth-interactive Voxel Aggregation Segmentation),一个无需优化、完全交互式的框架,以解决这些局限性。该方法通过快速的基于 GUI 的工作流程运行:由用户点提示生成的 2D SAM 掩码利用 NeRF 导出的深度先验进行细化,以提高几何精度和前景-背景分离效果。我们贡献的核心是一个定制的 CUDA 内核,它能在 200ms 内将这些细化后的多视图掩码聚合为统一的 3D 体素网格,从而实现实时视觉反馈。这种无需优化的设计消除了逐场景训练的需要。在 Mip-NeRF 360{\deg} 和 LLFF 上的实验表明,DivAS 实现了与基于优化的方法相当的分割质量,同时端到端速度快 2-2.5 倍,在排除用户提示时间的情况下快达一个数量级。
引用
@article{arxiv.2601.04860,
title = {DivAS: Interactive 3D Segmentation of NeRFs via Depth-Weighted Voxel Aggregation},
author = {Ayush Pande},
journal= {arXiv preprint arXiv:2601.04860},
year = {2026}
}