中文

具有跨任务一致性的多任务学习用于改进结肠镜深度估计

计算机视觉与模式识别 2023-12-01 v1 人工智能 多媒体

摘要

结肠镜筛查是评估结肠与直肠异常(如溃疡与癌性息肉)的金标准操作。测量异常黏膜面积及其三维重建有助于量化受检区域并客观评估疾病负担。然而,由于这些器官的复杂拓扑与可变物理条件(例如光照、大块同质纹理以及图像模态),估计距相机的距离(即深度)极具挑战。此外,多数结肠镜视频采集为单目,使深度估计成为非平凡问题。尽管计算机视觉中针对深度估计的方法已在自然场景数据集上被提出并取得进展,这些技术的效能在结肠镜数据集上尚未被广泛量化。由于结肠黏膜存在若干不明显的低纹理区域,从辅助任务学习表征可改进显著特征提取,从而实现准确相机深度估计。本工作中,我们提出开发一种新颖的多任务学习(MTL)方法,具有共享编码器与两个解码器,即表面法向解码器与深度估计解码器。我们的深度估计器融入注意力机制以增强全局上下文感知。我们利用表面法向预测来改进几何特征提取。同时,我们对两个几何相关任务(表面法向与相机深度)施加跨任务一致性损失。我们展示了相较最准确基线最先进 BTS 方法,相对误差改进 14.17%、δ1\delta_{1} 精度改进 10.4%。所有实验均在近期发布的 C3VD 数据集上进行;因此我们提供了最先进方法的首个基准。

关键词

引用

@article{arxiv.2311.18664,
  title  = {Multi-task learning with cross-task consistency for improved depth estimation in colonoscopy},
  author = {Pedro Esteban Chavarrias Solano and Andrew Bulpitt and Venkataraman Subramanian and Sharib Ali},
  journal= {arXiv preprint arXiv:2311.18664},
  year   = {2023}
}

备注

19 pages