中文

DARIL:当模仿学习在外科手术动作规划中优于强化学习

人工智能 2025-10-21 v3 计算机视觉与模式识别

摘要

外科手术动作规划需要预测未来的器械-动词-目标三元组以提供实时辅助。虽然远程操作机器人手术为模仿学习(IL)提供了自然的专家演示,但强化学习(RL)可能通过自我探索发现更优的策略。我们首次在CholecT50数据集上对IL与RL在外科手术动作规划任务中进行了全面比较。我们的双任务自回归模仿学习(DARIL)基线实现了34.6%的动作三元组识别mAP和33.6%的下一帧预测mAP,在10秒规划范围内平滑衰减至29.2%。我们评估了三种RL变体:基于世界模型的RL、直接视频RL和逆RL增强。令人惊讶的是,所有RL方法的表现均不如DARIL——世界模型RL在10秒时降至3.1% mAP,而直接视频RL仅达到15.9%。我们的分析表明,在专家标注的测试集上进行分布匹配,系统性地偏向于IL,而可能有效的、但与训练演示不同的RL策略则处于劣势。这挑战了关于RL在序列决策中优越性的假设,并为手术AI的发展提供了关键见解。

关键词

引用

@article{arxiv.2507.05011,
  title  = {DARIL: When Imitation Learning outperforms Reinforcement Learning in Surgical Action Planning},
  author = {Maxence Boels and Harry Robertshaw and Thomas C Booth and Prokar Dasgupta and Alejandro Granados and Sebastien Ourselin},
  journal= {arXiv preprint arXiv:2507.05011},
  year   = {2025}
}

备注

Paper accepted at the MICCAI2025 workshop proceedings on COLlaborative Intelligence and Autonomy in Image-guided Surgery (COLAS)