中文

SurgCUT3R:基于手术场景感知的连续时空 3D 表示理解

计算机视觉与模式识别 2026-03-10 v1

摘要

从单目内窥镜视频重建手术场景对于推动机器人辅助手术至关重要。然而,将最先进的通用重建模型应用于手术领域受到两个关键挑战的制约:缺乏监督训练数据以及随着视频序列长度增加导致性能下降。为克服这些限制,我们提出 SurgCUT3R,一个系统化框架,用于将统一的 3D 重建模型适应手术领域。我们的贡献有三方面:首先,我们开发了数据生成管道,利用公开的双目手术数据集生成大规模、度量尺度的伪地面深度图,从而弥合数据差距;其次,我们提出了混合监督策略,将伪地面与几何自校正相结合,以增强对内在数据缺陷的鲁棒性;最后,我们引入分层推理框架,使用两个专门模型有效缓解长时间手术视频中累积的姿态漂移:一个用于全局稳定性,一个用于局部精度。在 SCARED 和 StereoMIS 数据集上的实验表明,我们的方法在精度与效率之间实现了竞争平衡,接近最先进但大幅提速姿态估计,为手术环境中的稳健重建提供了实用且有效的解决方案。项目页面:https://chumo-xu.github.io/SurgCUT3R-ICRA26/。

关键词

引用

@article{arxiv.2603.06971,
  title  = {SurgCUT3R: Surgical Scene-Aware Continuous Understanding of Temporal 3D Representation},
  author = {Kaiyuan Xu and Fangzhou Hong and Daniel Elson and Baoru Huang},
  journal= {arXiv preprint arXiv:2603.06971},
  year   = {2026}
}