基于深度Transformer的胶囊内镜视频小肠区间快速定位
计算机视觉与模式识别
2021-04-08 v1
摘要
胶囊内镜是一种用于检查和诊断难治性胃肠道疾病的革命性技术。由于数据量巨大,分析胶囊内镜视频对胃肠科医生而言非常耗时耗力。因此,开发用于胶囊内镜视频区域定位与分析的智能长视频算法,对于减轻临床医生工作负担并辅助提高疾病诊断准确性至关重要。本文提出一种深度模型,用于从时长数十小时的胶囊内镜视频中定位小肠的拍摄区间。这是首次尝试使用深度神经网络方法解决小肠定位任务。我们将该任务建模为一个三分类问题,将每一视频帧划分为食管/胃、小肠或结直肠三类。为探索长程时间依赖,构建了Transformer模块来融合多个相邻帧的特征。基于该分类模型,我们设计了一种高效搜索算法,以高效定位小肠的起始与结束拍摄边界。我们的方法无需在全视频中穷举搜索小肠,而是通过沿指向目标边界的方向在中间迭代分割视频段来实现。我们从一家本地医院收集了113段视频来验证我们的方法。在5折交叉验证中,我们的方法定位的小肠区间与具有广域认证胃肠科医生标注的真值之间的平均IoU达到0.945。
引用
@article{arxiv.2104.02866,
title = {Deep Transformers for Fast Small Intestine Grounding in Capsule Endoscope Video},
author = {Xinkai Zhao and Chaowei Fang and Feng Gao and De-Jun Fan and Xutao Lin and Guanbin Li},
journal= {arXiv preprint arXiv:2104.02866},
year = {2021}
}