基于端到端多步骤自监督训练的机器内镜单目深度估计
计算机视觉与模式识别
2025-06-23 v1 机器人学
摘要
单目深度估计与自身运动估计是稳定、准确且高效的机器人内镜场景感知与导航的重要任务。为解决内镜场景中的光照变化和稀疏纹理问题,已有方法引入光流、轮廓流和内在图像分解等技术。然而,如何有效训练多个模块以同时处理照明问题和信息干扰仍是关键挑战。因此,本文提出一种新型框架,采用多步骤高效微调策略。在每个训练周期中,过程分为三个步骤:光流配准、多尺度图像分解和多变换对齐。每个步骤仅训练相关网络,避免无关信息的干扰。基于对基础模型的参数高效微调,所提方法在SCARED数据集上实现了自监督深度估计的状态突破,在Hamlyn数据集上实现零样本深度估计,误差降低4%~10%。本工作的代码已发布于https://github.com/BaymaxShao/EndoMUST。
引用
@article{arxiv.2506.16017,
title = {EndoMUST: Monocular Depth Estimation for Robotic Endoscopy via End-to-end Multi-step Self-supervised Training},
author = {Liangjing Shao and Linxin Bai and Chenkang Du and Xinrong Chen},
journal= {arXiv preprint arXiv:2506.16017},
year = {2025}
}
备注
Accepted by IROS 2025