统一尺度感知深度预测与感知先验,用于单目内镜姿态估计与组织重建
计算机视觉与模式识别
2025-08-18 v1
摘要
准确的单目内镜姿态估计和三维组织表面重建显著提升了 minimally invasive surgery( minimally invasive surgery)中单目操作的精准导航和空间感知能力。然而,单目内镜姿态估计和组织重建仍面临深度歧义、生理组织变形、内镜运动不一致、纹理保真度受限以及视野受限等持续挑战。为克服这些限制,本文提出一种统一框架,用于单目内窥镜组织重建,集成尺度感知深度预测与时序约束感知细化。该框架包含 novel MAPIS-Depth 模块,利用 Depth Pro 进行鲁棒初始化,结合 Depth Anything 实现高效逐帧深度预测,辅以 L-BFGS-B 优化,生成伪度量深度估计。这些估计通过计算像素对应关系(使用 RAFT)并基于 LPIPS 感知相似性自适应融合流场扭转后的帧,实现时序细化,从而减少因生理组织变形和运动引起的伪影。为确保合成伪 RGBD 帧的 MAPIS-Depth 正确配准,集成 novel WEMA-RTDL 模块,优化旋转和平移。最后应用基于截断有符号距离函数的体积融合与 marching cubes 算法,提取完整三维表面网格。在 HEVD 和 SCARED 数据集上进行消融与比较实验,结果表明该框架在鲁棒性和性能上均优于现有领先方法。
引用
@article{arxiv.2508.11282,
title = {Unifying Scale-Aware Depth Prediction and Perceptual Priors for Monocular Endoscope Pose Estimation and Tissue Reconstruction},
author = {Muzammil Khan and Enzo Kerkhof and Matteo Fusaglia and Koert Kuhlmann and Theo Ruers and Françoise J. Siepel},
journal= {arXiv preprint arXiv:2508.11282},
year = {2025}
}
备注
18 pages, 8 figures, 3 Tables, submitted to IEEE Access for review