中文

基于时空图卷积网络迈向可泛化的手术活动识别

计算机视觉与模式识别 2020-08-17 v4

摘要

手术活动的建模与识别提出了一个有趣的研究问题。尽管近期若干工作研究了手术活动的自动识别,这些工作在不同任务与不同数据集间的泛化性仍具挑战。我们引入了一种对场景变化鲁棒、且能够推断诸如方向性与相对空间关系等部件信息的模态。所提模态基于视频中手术工具的时空图表示,用于手术活动识别。为探究其有效性,我们利用所提模态对手术手势进行建模与识别。我们构建连接手术工具关节姿态估计的空间图。随后,我们将每个关节连接到连续帧中的对应关节,形成表示关节随时间轨迹的帧间边。然后,我们使用时空图卷积网络(ST-GCN)学习分层时空图表示。我们的实验表明,习得的时空图表示即使在单独使用时也在手术手势识别中表现良好。我们在 JIGSAWS 数据集的 Suturing 任务上进行实验,其中手势识别的随机基线为 10%。我们的结果展示了 68% 的平均准确率,表明显著改进。习得分层时空图表示可单独使用、级联使用或作为手术活动识别中的互补模态,从而为未来研究提供基准。据我们所知,我们的论文首次将手术工具的时空图表示以及基于姿态的骨架表示一般性地用于手术活动识别。

关键词

引用

@article{arxiv.2001.03728,
  title  = {Towards Generalizable Surgical Activity Recognition Using Spatial Temporal Graph Convolutional Networks},
  author = {Duygu Sarikaya and Pierre Jannin},
  journal= {arXiv preprint arXiv:2001.03728},
  year   = {2020}
}