中文

用于长胶囊内窥镜视频时序分割的无监督镜头边界检测

计算机视觉与模式识别 2021-10-19 v1

摘要

医生使用胶囊内窥镜 (CE) 作为一种非侵入性、非手术性的程序来检查整个胃肠道 (GI) 的疾病和异常。一次 CE 检查可能持续 8 到 11 小时,生成多达 80,000 帧并编译成视频。医生必须审查并分析整个视频,以在做出诊断前识别异常或疾病。这项审查任务可能非常繁琐、耗时且容易出错。虽然少至一帧可能捕捉到与医生最终诊断相关的有用内容,但仅覆盖小肠区域的帧就可能多达 50,000 帧。为了减少医生的审查时间和精力,本文提出了一种新颖的无监督且计算高效的时序分割方法,以自动将长 CE 视频划分为同质且可识别的视频片段。然而,使用高维帧特征矩阵在长视频中搜索时序边界在计算上是不可行的,且不适用于实际临床应用。因此,利用视频中的空间和时间信息,我们首先使用预训练的 CNN 模型提取高层帧特征,然后将高维帧特征矩阵投影到较低的一维嵌入中。使用这种一维序列嵌入,我们应用修剪精确线性时间 (PELT) 算法来搜索时序边界,这些边界指示了从正常帧到异常帧以及反之的过渡点。我们在多名真实患者的 CE 视频上进行了实验,我们的模型在多个测试视频上对专家提供的标签达到了 66\% 的 AUC。

关键词

引用

@article{arxiv.2110.09067,
  title  = {Unsupervised Shot Boundary Detection for Temporal Segmentation of Long Capsule Endoscopy Videos},
  author = {Sodiq Adewole and Philip Fernandes and James Jablonski and Andrew Copland and Michael Porter and Sana Syed and Donald Brown},
  journal= {arXiv preprint arXiv:2110.09067},
  year   = {2021}
}