基于运动学瓶颈方法直接从图像回归柔性手术器械位姿
机器人学
2021-03-02 v1 人工智能
计算机视觉与模式识别
摘要
器械的三维位姿估计是机器人微创外科手术中自动场景理解的关键步骤。尽管机器人系统有可能直接提供关节值,但由于其可能存在不可靠性、访问受限以及所需耗时的标定(尤其对于连续体机器人),该信息通常在手术室内未被利用。因此,三维位姿估计的标准方法涉及使用外部跟踪系统。近来,基于图像的方法已成为有前景的非侵入式替代方案。尽管文献中许多基于图像的方法已展示出准确结果,它们通常需要针对每幅处理图像进行复杂迭代优化(使其不适用于实时应用),或需要大量手动标注图像以实现高效学习。本文中我们提出一种自监督的基于图像的方法,仅在训练时利用机器人提供的不精确运动学信息。为避免引入耗时的手动标注,该问题被表述为自动编码器,并借助机器人器械与手术相机的物理模型进行智能瓶颈约束,迫使图像背景与运动学内容分离。该方法在采用柔性机器人化内窥镜获取的半合成、体模和体内数据集上进行了验证,显示出对手术器械实时基于图像的三维位姿估计的良好前景。
引用
@article{arxiv.2103.00586,
title = {A Kinematic Bottleneck Approach For Pose Regression of Flexible Surgical Instruments directly from Images},
author = {Luca Sestini and Benoit Rosa and Elena De Momi and Giancarlo Ferrigno and Nicolas Padoy},
journal= {arXiv preprint arXiv:2103.00586},
year = {2021}
}