基于状态变化学习的内窥镜视频事件预测
计算机视觉与模式识别
2025-10-16 v1
摘要
术前未来预测是一种以实时人工智能分析手术视频为驱动的关键技术,对提高手术室的安全性和效率至关重要。它能够提供关于即将发生事件、其时间以及风险的可操作性见解,从而实现更好的资源分配、仪器准备以及对并发症(如出血、胆管损伤)的早期警报。尽管存在这种需求,但当前的手术人工智能研究主要聚焦于理解正在发生的事情,而非预测未来事件。现有方法针对特定任务以孤立方式进行设计,缺乏能够涵盖短期(动作三元组、事件)和长期(手术剩余时长、阶段转换)时间范围的统一方法。这些方法依赖粗粒度监督信号,而细粒度的手术动作三元组和步骤则鲜有探索。此外,仅基于未来特征预测的方法在不同的手术情境和程序之间难以泛化。我们通过将手术未来预测重新建模为状态变化学习来克服这些限制。与预测原始观察不同,我们的方法对当前与未来时间步之间的状态转换进行分类。我们引入 SurgFUTR,通过教师-学生架构实现这一目标。视频片段通过 Sinkhorn-Knopp 聚类压缩为状态表示;教师网络从当前和未来片段中学习,而学生网络则仅从当前视频预测未来状态,并由我们的行动动力学(ActDyn)模块引导。我们建立了 SFPBench,包含五个预测任务,涵盖短期(三元组、事件)和长期(剩余手术时长、阶段和步骤转换)多个时间尺度。实验在四个数据集和三个手术程序上均显示出一致的改进。跨程序迁移验证了其泛化能力。
引用
@article{arxiv.2510.12904,
title = {State-Change Learning for Prediction of Future Events in Endoscopic Videos},
author = {Saurav Sharma and Chinedu Innocent Nwoye and Didier Mutter and Nicolas Padoy},
journal= {arXiv preprint arXiv:2510.12904},
year = {2025}
}
备注
24 pages, 13 figures