EndoOmni:通过从噪声标签中鲁棒自学习实现内窥镜零样本跨数据集深度估计
计算机视觉与模式识别
2025-01-07 v4
摘要
单图像深度估计对于内窥镜任务(如定位、重建和增强现实)至关重要。外科手术场景中的现有方法大多聚焦于领域内深度估计,限制了其在真实世界中的适用性。这一限制源于用于训练的医学数据稀缺且标注质量较差。在本工作中,我们提出了 EndoOmni,这是首个用于内窥镜零样本跨域深度估计的基础模型。为发挥多样化训练数据的潜力,我们改进了先进的自学习范式,该范式采用教师模型生成伪标签,以指导在大规模有标签和无标签数据上训练的学生模型。为解决深度标签固有噪声引起的训练干扰,我们提出了一种鲁棒训练框架,利用深度标签和来自教师模型的估计置信度共同指导学生模型训练。此外,我们提出了一种加权尺度与平移不变损失,以根据标签置信度自适应调整学习权重,从而将学习偏置向更干净的标签像素倾斜,同时降低高噪声像素的影响。零样本相对深度估计实验表明,在特定数据集的绝对相对误差指标上,我们的 EndoOmni 较医学成像领域的 SOTA 方法提升了 33%,较现有基础模型提升了 34%。此外,我们的模型为微调度量深度估计提供了良好的初始化,在领域内和领域外场景中均保持了优越性能。源代码已公开于 https://github.com/TianCuteQY/EndoOmni。
引用
@article{arxiv.2409.05442,
title = {EndoOmni: Zero-Shot Cross-Dataset Depth Estimation in Endoscopy by Robust Self-Learning from Noisy Labels},
author = {Qingyao Tian and Zhen Chen and Huai Liao and Xinyan Huang and Lujie Li and Sebastien Ourselin and Hongbin Liu},
journal= {arXiv preprint arXiv:2409.05442},
year = {2025}
}