中文

结肠镜视频深度估计的结构保持图像转换

计算机视觉与模式识别 2024-08-20 v1

摘要

结肠镜视频中的单目深度估计旨在克服结肠镜检查环境的异常光照特性。该领域的主要挑战之一是标注但不真实的合成数据与未标注但真实的临床数据之间的域差距。此前直接弥合这一域差距的尝试都针对深度估计任务本身。我们提出了一种通用的结构保持合成到真实(sim2real)图像转换流水线(生成输入图像的修改版本),以在转换过程中保留深度几何。这使我们能够生成大量外观逼真的合成图像,用于具有向临床域改进泛化能力的监督深度估计。我们还提出了一套从临床结肠镜检查中手工挑选的序列数据集,以改进图像转换过程。通过下游深度估计在各种数据集上的性能,我们同时展示了转换图像的逼真性和深度图的保持。

关键词

引用

@article{arxiv.2408.10153,
  title  = {Structure-preserving Image Translation for Depth Estimation in Colonoscopy Video},
  author = {Shuxian Wang and Akshay Paruchuri and Zhaoxi Zhang and Sarah McGill and Roni Sengupta},
  journal= {arXiv preprint arXiv:2408.10153},
  year   = {2024}
}

备注

12 pages, 7 figures, accepted at MICCAI 2024