EndoSLAM 数据集及一种面向内窥镜视频的无监督单目视觉里程计与深度估计方法:Endo-SfMLearner
计算机视觉与模式识别
2020-10-02 v3
摘要
深度学习技术有望为内窥镜视频开发稠密地形重建与位姿估计方法。然而,当前可用的数据集无法支持有效的定量基准测试。本文介绍了一个综合的内窥镜 SLAM 数据集,包含六个猪器官的三维点云数据、胶囊与标准内窥镜记录以及合成生成的数据。采用 Panda 机械臂、两个市售胶囊内窥镜、两个具有不同相机特性的常规内窥镜以及两台高精度三维扫描仪,从 8 个离体猪胃肠(GI)道器官采集数据。离体部分共提供 35 个带有 6D 位姿真值子数据集:结肠 18 个、胃 12 个、小肠 5 个,其中四个包含由专家胃肠病学家制作的息肉模拟隆起。包含带有深度与位姿标注的 GI 道合成胶囊内窥镜帧,以促进仿真到真实迁移学习算法的研究。此外,我们提出 Endo-SfMLearner,一种无监督单目深度与位姿估计方法,其将残差网络与空间注意力模块结合,以引导网络关注可分辨且高纹理的组织区域。所提方法利用亮度感知光度损失以提升在帧间快速光照变化下的鲁棒性。为示例 EndoSLAM 数据集的用例,Endo-SfMLearner 的性能与最先进技术进行了广泛比较。代码与数据集链接公开于 https://github.com/CapsuleEndoscope/EndoSLAM。展示实验设置与过程的视频可通过 https://www.youtube.com/watch?v=G_LCe0aWWdQ 访问。
引用
@article{arxiv.2006.16670,
title = {EndoSLAM Dataset and An Unsupervised Monocular Visual Odometry and Depth Estimation Approach for Endoscopic Videos: Endo-SfMLearner},
author = {Kutsev Bengisu Ozyoruk and Guliz Irem Gokceler and Gulfize Coskun and Kagan Incetan and Yasin Almalioglu and Faisal Mahmood and Eva Curto and Luis Perdigoto and Marina Oliveira and Hasan Sahin and Helder Araujo and Henrique Alexandrino and Nicholas J. Durr and Hunter B. Gilbert and Mehmet Turan},
journal= {arXiv preprint arXiv:2006.16670},
year = {2020}
}
备注
27 pages, 16 figures