中文

基于视频语义聚合的手术技能评估

计算机视觉与模式识别 2022-08-05 v1

摘要

基于视频的自动化手术技能评估是一项极具前景的任务,可用于辅助年轻外科受训者,尤其在资源匮乏地区。现有工作常采用CNN-LSTM联合框架,通过对空间池化后的短期CNN特征使用LSTM来建模长期关系。然而,这种做法不可避免地会忽略工具、组织和背景等语义概念在空间维度上的差异,阻碍后续的时间关系建模。本文提出一种新颖的技能评估框架——视频语义聚合(ViSA),其可发现不同的语义部分并在时空维度上对其进行聚合。对语义部分的显式发现提供了一种解释性可视化,有助于理解神经网络的决策。它还使我们能够进一步融合运动学数据等辅助信息,以改进表示学习与性能。在两个数据集上的实验表明,与最先进的方法相比,ViSA具有竞争力。源代码见:bit.ly/MICCAI2022ViSA。

关键词

引用

@article{arxiv.2208.02611,
  title  = {Surgical Skill Assessment via Video Semantic Aggregation},
  author = {Zhenqiang Li and Lin Gu and Weimin Wang and Ryosuke Nakamura and Yoichi Sato},
  journal= {arXiv preprint arXiv:2208.02611},
  year   = {2022}
}

备注

To appear in MICCAI 2022