基于损失泛化的单目内窥镜深度与位姿估计
计算机视觉与模式识别
2021-07-29 v1
摘要
胃肠内窥镜已成为诊断和治疗影响患者消化系统部分(如胃)疾病的临床标准。尽管胃肠内窥镜对患者有许多优势,但对操作者仍存在若干挑战,例如缺乏三维感知,包括深度与内窥镜位姿信息。这些挑战使得在消化道中导航内窥镜并定位任何发现的病变变得困难。为应对这些问题,已有基于深度学习的方法被提出,以为单目胃肠内窥镜提供额外却重要的深度与位姿信息。本文中,我们提出一种新颖的有监督方法,利用连续的内窥镜图像训练深度与位姿估计网络,以辅助胃内内窥镜导航。我们首先使用先前提出的全胃三维重建流程生成真实深度与位姿训练数据,以避免胃的计算机生成(CG)模型与真实数据之间泛化能力不佳的问题。此外,我们提出一种新颖的泛化光度损失函数,以避免现有直接深度与位姿监督方法所需的为平衡深度与位姿损失项寻找适当权重的复杂过程。随后我们通过实验表明,我们提出的泛化损失优于现有的直接监督损失。
引用
@article{arxiv.2107.13263,
title = {Learning-Based Depth and Pose Estimation for Monocular Endoscope with Loss Generalization},
author = {Aji Resindra Widya and Yusuke Monno and Masatoshi Okutomi and Sho Suzuki and Takuji Gotoda and Kenji Miki},
journal= {arXiv preprint arXiv:2107.13263},
year = {2021}
}
备注
Accepted for EMBC 2021