中文

基于框架的手术手势序列识别与临床结果预测 AI 系统

人工智能 2025-11-18 v1 计算机视觉与模式识别

摘要

对内镜行为的细粒度分析及其对患者结果的影响一直是长期的挑战。我们提出 Frame-to-Outcome(F2O),一个端到端系统,将组织切削视频转换为手势序列并揭示与术后结果相关的模式。利用基于转换器的空间和时间建模以及帧级分类,F2O 在机器人辅助根治性前列腺切除术(RARP)的神经保留步骤中稳健地检测连续短约 2 秒的手势(帧级 AUC: 0.80;视频级 AUC: 0.81)。F2O 派生的特征(手势频率、持续时间和转换)预测术后结果的准确率相当于人类标注(0.79 vs. 0.75;重叠 95% 置信区间)。在 25 个共享特征中,效应大小方向与小差异(~0.07)一致,并呈现强相关性(r = 0.96, p < 1e-14)。F2O 还捕捉到与勃起功能恢复相关的关键模式,包括延长组织剥离和减少能源使用。通过实现自动可解释评估,F2O 为数据驱动的手术反馈和前瞻性临床决策支持奠定了基础。

关键词

引用

@article{arxiv.2511.11899,
  title  = {End to End AI System for Surgical Gesture Sequence Recognition and Clinical Outcome Prediction},
  author = {Xi Li and Nicholas Matsumoto and Ujjwal Pasupulety and Atharva Deo and Cherine Yang and Jay Moran and Miguel E. Hernandez and Peter Wager and Jasmine Lin and Jeanine Kim and Alvin C. Goh and Christian Wagner and Geoffrey A. Sonn and Andrew J. Hung},
  journal= {arXiv preprint arXiv:2511.11899},
  year   = {2025}
}