基于视觉Transformer的结肠镜解剖标志检测
计算机视觉与模式识别
2022-09-28 v2 人工智能
机器学习
摘要
结肠镜检查是一种常规的门诊操作,用于检查结肠和直肠是否存在包括息肉、憩室和结肠结构狭窄在内的任何异常。临床医生在结肠镜检查过程中花费大量时间对拍摄的快照进行后处理,以维护医疗记录或作进一步调查。自动化这一步骤可以节省时间并提高流程效率。在我们的工作中,我们收集了 120 段结肠镜视频和 2416 张过程中拍摄的、由专家标注的快照数据集。此外,我们开发了一种新颖的、基于视觉Transformer的标志检测算法,从结肠镜检查快照中识别关键解剖标志(阑尾开口、回盲瓣/盲肠标志和直肠倒镜)。我们的算法在预处理中使用自适应伽马校正以保持所有图像亮度一致。随后我们使用视觉Transformer作为特征提取骨干,并使用基于全连接网络的分类头将给定帧分类为四类:三个标志或非负帧。我们将视觉Transformer(ViT-B/16)骨干与以类似方式训练的 ResNet-101 和 ConvNext-B 骨干进行比较。我们在快照测试数据集上报告了视觉Transformer骨干 82% 的准确率。
引用
@article{arxiv.2209.11304,
title = {Colonoscopy Landmark Detection using Vision Transformers},
author = {Aniruddha Tamhane and Tse'ela Mida and Erez Posner and Moshe Bouhnik},
journal= {arXiv preprint arXiv:2209.11304},
year = {2022}
}
备注
Accepted for publication at Imaging Systems for GI Endoscopy workshop at the 25th International Conference on Medical Image Computing and Computer Assisted Intervention- MICCAI 2022 ISGIE