中文

VGGT-Segmentor:基于几何增强的跨视图分割

计算机视觉与模式识别 2026-05-25 v3

摘要

实例级对象在不同于中心视角和外中心视角之间的分割是视觉理解中的一项基本挑战,对嵌入式 AI 和远程协作等应用至关重要。由于尺度、视角和遮挡的严重变化导致直接的像素级匹配高度不稳定。虽然近期的几何感知模型如 VGGT 为特征对齐提供了强大的基础,但我们发现它们在密集预测任务中常常因显著的像素级投影漂移而失败,尽管其内部的对象级注意力保持一致。为弥合这一差距,我们引入 VGGT-Segmentor(VGGT-S),一个将稳健几何建模与像素精确语义分割统一的框架。VGGT-S 利用 VGGT 的强大跨视图特征表示,引入新颖的联合分割头部。该头部包含三个阶段:掩码提示融合、点引导预测和迭代掩码细化,有效地将高层特征对齐转化为精确的分割掩码。此外,我们提出一种单图像自监督训练策略,无需配对标注即可实现强大的泛化。在 Ego-Exo4D 基准测试上,VGGT-S 取得了 67.7% 和 68.0% 的平均 IoU 用于 Ego 到 Exo 和 Exo 到 Ego 任务,显著优于先前方法。值得注意的是,我们的对应关系-free 预训练模型超过了大多数完全监督的基线,展示了该方法的有效性和可扩展性。代码已公开:https://github.com/buaa-colalab/VGGT-S。

关键词

引用

@article{arxiv.2604.13596,
  title  = {VGGT-Segmentor: Geometry-Enhanced Cross-View Segmentation},
  author = {Yulu Gao and Bohao Zhang and Zongheng Tang and Jitong Liao and Wenjun Wu and Si Liu},
  journal= {arXiv preprint arXiv:2604.13596},
  year   = {2026}
}