中文

DINO-CVA:面向自主导管导航的多模态目标条件视觉到动作模型

机器人学 2025-10-21 v1 人工智能 计算机视觉与模式识别

摘要

心脏介入管介入仍是 minimally invasive介入的基石,但仍严重依赖手动操作。尽管机器人平台取得了进展,现有系统主要是follow-leader体质,要求持续的医生输入,缺乏智能自主性。这种依赖导致操作者疲劳、更多的辐射暴露以及程序结果的差异性。本工作通过引入DINO-CVA,一种多模态目标条件行为克隆框架,推进自主导管导航。所提模型将视觉观察和摇杆运动学融合到联合嵌入空间中,实现既视觉感知又运动学感知的策略。动作以专家演示的自回归方式预测,目标条件引导导航指向指定目的地。设计了一个带有合成血管幽灵的机器人实验 setup,用于收集多模态数据并评估性能。结果表明,DINO-CVA在预测动作方面达到了高准确率,匹配 kinematics-only基线的性能,同时还能将预测锚定在解剖环境中。这些发现表明,多模态、目标条件的架构对于导管导航是可行的,标志着一个重要的步骤,旨在减少操作者依赖并提高导管治疗的可靠性。

关键词

引用

@article{arxiv.2510.17038,
  title  = {DINO-CVA: A Multimodal Goal-Conditioned Vision-to-Action Model for Autonomous Catheter Navigation},
  author = {Pedram Fekri and Majid Roshanfar and Samuel Barbeau and Seyedfarzad Famouri and Thomas Looi and Dale Podolsky and Mehrdad Zadeh and Javad Dargahi},
  journal= {arXiv preprint arXiv:2510.17038},
  year   = {2025}
}