SegVGGT:从多视图图像进行联合 3D 重建与实例分割
计算机视觉与模式识别
2026-03-23 v1
摘要
3D 实例分割方法通常依赖于高质量的点云或带姿态的 RGB-D 扫描,需复杂的多阶段处理流程,且对重建噪声高度敏感。虽然近期的前馈变换器 revolutionized 了多视图 3D 重建,但其仍与高层语义理解脱节。在本工作中,我们提出 SegVGGT,一个统一的端到端框架,同时直接从多视图 RGB 图像进行前馈 3D 重建与实例分割。通过引入与多层几何特征交互的对象查询,我们的方法深入地将实例识别集成到基于视觉几何的变换器中。为解决由大量全局图像标记导致的注意力扩散严重问题,我们提出了帧级注意力分布对齐(FADA)策略。FADA 在训练期间显式引导对象查询注意力落在与实例相关的帧上,提供结构化监督,无需额外的推理开销。广泛的实验表明,SegVGGT 在 ScanNetv2 和 ScanNet200 上实现了最先进的性能,超越了最近的联合模型和基于 RGB-D 的方法,同时在 ScanNet++ 上表现出强大的泛化能力。
引用
@article{arxiv.2603.19926,
title = {SegVGGT: Joint 3D Reconstruction and Instance Segmentation from Multi-View Images},
author = {Jinyuan Qu and Hongyang Li and Lei Zhang},
journal= {arXiv preprint arXiv:2603.19926},
year = {2026}
}