中文

EndoVLA:用于内窥镜自主跟踪的双相视觉语言-动作模型

机器人学 2025-08-21 v1 人工智能

摘要

在内窥镜操作中,跟踪异常区域和遵循周围切割标记可显著减轻内镜医生的认知负担。然而,传统的基于模型的管道对每个组件(例如检测、运动规划)都需要手动调谐,且难以整合高层内窥镜意图,导致在 diverse 场景下泛化性能差。视觉语言-动作(VLA)模型将视觉感知、语言定位和运动规划整合到 end-to-end 框架中,通过语义适应外科医生提示而无需手动重新调校,提供了有前景的替代方案。尽管存在这种潜力,但将 VLA 模型应用于机器人内窥镜面临独特挑战,因为胃肠道(GI) tract 的解剖环境复杂且动态。为此,我们提出 EndoVLA,专为 GI 插手中的连续机器人设计。给定内窥镜图像和外科医生发布的跟踪提示,EndoVLA 执行三个核心任务:(1)息肠跟踪,(2)描绘并跟踪异常黏膜区域,(3)在周围切割中遵循圆形标记。为解决数据稀缺和域迁移问题,我们提出一种双相策略,包括在 EndoVLA-Motion 数据集上进行监督微调以及使用任务感知奖励进行强化学习微调。我们的方法显著提高了内窥镜中的跟踪性能,并实现了 diverse 场景和复杂顺序任务的零样本泛化。

关键词

引用

@article{arxiv.2505.15206,
  title  = {EndoVLA: Dual-Phase Vision-Language-Action Model for Autonomous Tracking in Endoscopy},
  author = {Chi Kit Ng and Long Bai and Guankun Wang and Yupeng Wang and Huxin Gao and Kun Yuan and Chenhan Jin and Tieyong Zeng and Hongliang Ren},
  journal= {arXiv preprint arXiv:2505.15206},
  year   = {2025}
}