无显式深度图的内镜手术立体视频重建
图像与视频处理
2021-09-20 v1 计算机视觉与模式识别
机器学习
摘要
我们引入了立体视频重建(或等价地,微创外科视频的 2D 到 3D 视频转换)任务。我们通过改变输入(单帧 vs. 多连续帧)、损失函数(MSE、MAE 或感知损失)和网络架构,为此任务设计实现了一系列端到端基于 U-Net 的方案。我们通过调查十位专家——常规进行内镜手术的外科医生——来评估这些方案。我们进行了两项独立的读者研究:一项评估单帧,另一项评估在 VR 头显上播放的完整重建 3D 视频。在第一项读者研究中,一种以多连续视频帧为输入并输出缺失视角的 U-Net 变体表现最佳。我们由此得出两点结论:第一,来自多个过去帧的运动信息对重建立体视觉至关重要;第二,所提 U-Net 变体确实可利用此类运动信息解决该任务。第二项研究的结果进一步确认了所提 U-Net 变体的有效性。外科医生报告他们能成功从重建 3D 视频片段感知深度,并明确偏好重建 3D 视频胜于原始 2D 视频。这两项读者研究有力支持了所提微创外科视频立体重建任务的有用性,并指出深度学习是该任务的一种有前景的方法。最后,我们确定了两个自动指标 LPIPS 和 DISTS,它们与专家判断强相关,可在未来研究中作为后者的替代。
引用
@article{arxiv.2109.08227,
title = {Stereo Video Reconstruction Without Explicit Depth Maps for Endoscopic Surgery},
author = {Annika Brundyn and Jesse Swanson and Kyunghyun Cho and Doug Kondziolka and Eric Oermann},
journal= {arXiv preprint arXiv:2109.08227},
year = {2021}
}
备注
9 pages, 5 figures