SutureFormer: 通过基于目标的离线强化学习在像素空间学习手术轨迹
机器人学
2026-05-19 v2 人工智能
摘要
从内窥镜视频中预测手术针轨迹对机器人辅助缝合至关重要,可实现前瞻性规划、实时引导和更安全的运动执行。现有直接从视觉观测学习运动分布的方法往往忽略相邻运动步骤之间的序列依赖性。此外,稀疏的路径点标注往往无法提供足够的监督,进一步增加了监督学习或模仿学习方法的难度。为应对这些挑战,我们将基于图像的针轨迹预测建模为一个序贯决策问题,其中针尖被视为在像素空间中逐步移动的智能体。该公式自然地捕捉了针运动的连续性,并支持对随时间变化的物理上合理的像素级状态转移进行显式建模。基于此视角,我们提出了SutureFormer,一个基于目标的离线强化学习框架,通过三次样条插值将稀疏标注转化为密集奖励信号,鼓励策略在利用有限专家指导的同时探索合理的未来运动路径。SutureFormer使用观测编码器编码可变长度片段,以捕捉局部空间线索和长程时序动力学,并通过由离散方向和连续幅度组成的动作自回归地预测未来路径点。为实现来自专家演示的稳定离线策略优化,我们采用带行为克隆正则化的保守Q学习(Conservative Q-Learning)。在一个包含来自50名患者的1,158条轨迹的新肾脏伤口缝合数据集上的实验表明,SutureFormer相比最强基线将平均位移误差降低了58.6%,证明了将针轨迹预测建模为像素级序贯动作学习的有效性。
引用
@article{arxiv.2603.26720,
title = {SutureFormer: Learning Surgical Trajectories via Goal-conditioned Offline RL in Pixel Space},
author = {Huanrong Liu and Chunlin Tian and Tongyu Jia and Tailai Zhou and Qin Liu and Yu Gao and Yutong Ban and Yun Gu and Guy Rosman and Xin Ma and Qingbiao Li},
journal= {arXiv preprint arXiv:2603.26720},
year = {2026}
}