中文

ACT-Net:手术视频中的锚点-上下文动作检测

计算机视觉与模式识别 2023-10-06 v1

摘要

手术精细动作的识别与定位是开发情境感知决策支持系统的关键组成部分。然而,大多数现有检测算法即便给出了动作位置,也无法提供高精度的动作类别,因为它们未考虑整段视频中手术操作的规律性。这一局限阻碍了它们的应用。此外,在临床应用中部署预测结果迫切需要将模型置信度传达以赢得信任,而这一点在手术动作预测中尚属空白。本文中,为准确检测每时每刻发生的细粒度动作,我们提出了一种锚点-上下文动作检测网络(ACTNet),包含锚点-上下文检测(ACD)模块与类条件扩散(CCD)模块,以回答以下问题:1)动作发生于何处;2)动作是什么;3)预测置信度如何。具体而言,所提 ACD 模块在空间和时间上高亮显示与手术视频中提取的锚点交互的区域,并基于锚点-上下文交互输出动作位置及其类别分布。考虑到视频中动作类别的完整分布,CCD 模块采用以我们的 ACD 估计量为条件的基于去噪扩散的生成模型,进一步精确重建动作预测。此外,我们利用扩散模型输出的随机特性来获取各预测的模型置信度。我们的方法取得了当前最优性能,在手术视频数据集上相较基线 mAP 提升 4.0%。

关键词

引用

@article{arxiv.2310.03377,
  title  = {ACT-Net: Anchor-context Action Detection in Surgery Videos},
  author = {Luoying Hao and Yan Hu and Wenjun Lin and Qun Wang and Heng Li and Huazhu Fu and Jinming Duan and Jiang Liu},
  journal= {arXiv preprint arXiv:2310.03377},
  year   = {2023}
}

备注

Accepted early by MICCAI2023 (Oral)