用于机器人血管内导丝导航上下文感知奖励建模的视觉-语言过程推理
机器人学
2026-06-29 v1
摘要
机器人辅助血管内介入要求在复杂且患者特异性的血管解剖结构中进行准确、稳定且上下文感知的导丝导航。尽管在机器人精度和基于学习的控制方面取得了最新进展,但现有的自主导航方法仍因其依赖静态奖励函数以及缺乏关于解剖上下文和任务进度的显式过程推理而受到限制。为了应对这些挑战,本文提出了一种用于自主导丝导航的视觉-语言过程推理 (VL-PR) 框架。该框架集成了一个多模态大语言模型 (MLLM) 作为过程推理模块,解释实时视觉观察以推断高层导航上下文。推断出的过程见解不直接生成低级控制命令,而是通过在不同导航阶段动态调整奖励组件的重要性,实现上下文感知的奖励自适应。这种方法允许单一策略解决竞争目标并处理复杂过渡,同时保持一致的全局任务目标。在物理机器人平台上的多种血管场景实验证明了增强的任务可靠性和精简的导航效率,突显了相较于静态奖励方法的优势,并为复杂多任务机器人血管内手术提供了可扩展的解决方案。
引用
@article{arxiv.2606.30698,
title = {Vision-Language Procedural Reasoning for Context-Aware Reward Modeling of Robotic Endovascular Guidewire Navigation},
author = {Wentong Tian and Jiyuan Zhao and Tianliang Yao and Yuxiang Fan and Zhengyu Shi and Dong Liu and Peng Qi},
journal= {arXiv preprint arXiv:2606.30698},
year = {2026}
}
备注
This paper has been accepted by IEEE/RSJ IROS 2026. 7 pages, 4 figures, 2 tables