中文

Endo3R:来自动态单目内窥镜视频的统一在线重建

计算机视觉与模式识别 2025-04-07 v1 人工智能

摘要

从单目外科视频重建 3D 场景可增强外科医生的感知能力,从而在 various computer-assisted surgery 任务中发挥关键作用。然而,由于内窥镜视频固有的动态变形和无纹理表面问题,实现规模一致的重建仍是一个开放挑战。尽管近期研究取得了进展,当前方法要么依赖标定或仪器先验来估计规模,要么采用类似 SfM 的多阶段流程,导致误差累积并需要离线优化。在本文中,我们提出了 Endo3R,这是一个用于从单目外科视频进行在线规模一致重建的统一 3D 基础模型,无需任何先验或额外优化。我们的模型通过预测全球对齐点图、规模一致的视频深度以及相机参数,实现无需离线优化的任务统一。本方法的核心贡献在于通过不确定性感知双记忆机制,将最新的两两重建模型扩展到长期增量动态重建。该机制维护短期动态和长期空间一致性的历史记忆。值得注意的是,针对手术场景的高度动态特性,我们通过 Sampson 距离测量记忆单元的不确定性并过滤掉高不确定性的记忆单元。在外窥镜数据集稀缺缺乏带有真实深度和相机姿态的数据方面,我们进一步设计了一种自监督机制,采用新颖的 dynamics-aware flow 损失。大量实验在 SCARED 和 Hamlyn 数据集上表明,我们在零样本外科视频深度预测和相机姿态估计方面表现优异,同时实现在线效率。项目页面:https://wrld.github.io/Endo3R/。

关键词

引用

@article{arxiv.2504.03198,
  title  = {Endo3R: Unified Online Reconstruction from Dynamic Monocular Endoscopic Video},
  author = {Jiaxin Guo and Wenzhen Dong and Tianyu Huang and Hao Ding and Ziyi Wang and Haomin Kuang and Qi Dou and Yun-Hui Liu},
  journal= {arXiv preprint arXiv:2504.03198},
  year   = {2025}
}