中文

用于内窥镜视频中实时器械分割的多帧特征聚合

计算机视觉与模式识别 2021-07-27 v2

摘要

基于深度学习的方法在手术器械分割上取得了有前景的结果。然而,高计算成本可能限制深度模型在诸如机器人辅助手术的在线手术视频分析等时间敏感任务中的应用。此外,当前方法仍可能受手术图像中诸如不同光照条件和血液存在等挑战性条件的影响。我们提出了一种新颖的多帧特征聚合 (MFFA) 模块,以循环模式在时间上和空间上聚合视频帧特征。通过将深度特征提取的计算负载分布到连续帧上,我们可以使用轻量编码器来降低每个时间步的计算成本。此外,公开手术视频通常并非逐帧标注,因此我们开发了一种可从单张标注帧随机合成手术帧序列以辅助网络训练的方法。我们证明了我们的方法在两个公开手术数据集上取得了优于相应更深分割模型的性能。

关键词

引用

@article{arxiv.2011.08752,
  title  = {Multi-frame Feature Aggregation for Real-time Instrument Segmentation in Endoscopic Video},
  author = {Shan Lin and Fangbo Qin and Haonan Peng and Randall A. Bly and Kris S. Moe and Blake Hannaford},
  journal= {arXiv preprint arXiv:2011.08752},
  year   = {2021}
}

备注

Published in IEEE Robotics and Automation Letters (Early Access)