基于多标签时间网络的内窥镜视频语义解析
计算机视觉与模式识别
2024-03-14 v2
摘要
在息肉检测与表征成功问世之后,结肠镜检正被开发更多高级自动化工具。诸如质量指标或报告生成等新自动化任务,需要理解包含操作、事件、解剖标志等在内的手术流程。本工作中我们提出一种结肠镜视频自动语义解析方法。该方法采用一种新颖的DL多标签时间分割模型,在监督与无监督两种机制下训练。我们在超过300段标注结肠镜视频的测试集上评估了方法精度,并通过消融实验探究各方法组件的相对重要性。
引用
@article{arxiv.2306.06960,
title = {Semantic Parsing of Colonoscopy Videos with Multi-Label Temporal Networks},
author = {Ori Kelner and Or Weinstein and Ehud Rivlin and Roman Goldenberg},
journal= {arXiv preprint arXiv:2306.06960},
year = {2024}
}