基于伪标签引导的跨视频像素对比的有限标注机器人手术场景分割
计算机视觉与模式识别
2022-07-21 v1
摘要
手术场景分割对于促进机器人手术中的认知辅助具有根本性的重要意义。然而,以逐帧方式对手术视频进行像素级标注是昂贵且耗时的。为了大幅减轻标注负担,在这项工作中,我们研究机器人手术视频的半监督场景分割,这在实践中至关重要但此前很少被探索。我们考虑在等距采样下的临床适用标注情形。然后我们提出PGV-CL,一种新颖的伪标签引导跨视频对比学习方法以提升场景分割。它有效利用未标注数据进行可信且全局的模型正则化,产生更具判别性的特征表示。具体而言,对于可信表示学习,我们提出引入伪标签来指导配对选择,获得更可靠的像素对比表示对。此外,我们将表示学习空间从先前的图像级扩展到跨视频,这可以捕捉全局语义以有益于学习过程。我们在公共机器人手术数据集EndoVis18和公共白内障数据集CaDIS上广泛评估了我们的方法。实验结果证明了我们方法的有效性,在不同标注比例下持续优于最先进的半监督方法,甚至在EndoVis18上以10.1%标注超越全监督训练。
引用
@article{arxiv.2207.09664,
title = {Pseudo-label Guided Cross-video Pixel Contrast for Robotic Surgical Scene Segmentation with Limited Annotations},
author = {Yang Yu and Zixu Zhao and Yueming Jin and Guangyong Chen and Qi Dou and Pheng-Ann Heng},
journal= {arXiv preprint arXiv:2207.09664},
year = {2022}
}
备注
Accepted by IROS 2022