探索视频内与视频间关系用于手术语义场景分割
计算机视觉与模式识别
2022-06-27 v2
摘要
自动手术场景分割是促进现代手术室认知智能的基础。以往工作依赖于仅利用局部上下文的传统聚合模块(如空洞卷积、卷积LSTM)。本文中,我们提出一种新颖框架STswinCL,通过逐步捕获全局上下文来探索互补的视频内与视频间关系以提升分割性能。我们首先开发一种层次化Transformer以捕获视频内关系,其包含来自邻域像素与前序帧的更丰富空间与时间线索。提出一种联合时空窗口偏移方案,将这些线索高效聚合至每个像素嵌入中。随后,我们通过像素到像素的对比学习探索视频间关系,其良好地结构化了全局嵌入空间。我们开发了多源对比训练目标,以在真实标注引导下对跨视频的像素嵌入进行分组,这对于学习整体数据的全局属性至关重要。我们在两个公开手术视频基准(包括EndoVis18 Challenge与CaDIS数据集)上广泛验证了我们的方法。实验结果展示了我们方法的前景性能,其一致地超越了以往最先进方法。代码见 https://github.com/YuemingJin/STswinCL。
引用
@article{arxiv.2203.15251,
title = {Exploring Intra- and Inter-Video Relation for Surgical Semantic Scene Segmentation},
author = {Yueming Jin and Yang Yu and Cheng Chen and Zixu Zhao and Pheng-Ann Heng and Danail Stoyanov},
journal= {arXiv preprint arXiv:2203.15251},
year = {2022}
}
备注
Accepted at IEEE TMI