用于自适应超声引导针头插入与针头跟踪的视觉-语言-动作模型
机器人学
2026-04-23 v1 人工智能
摘要
超声引导下的针头插入是一项关键但具有挑战性的操作,原因在于动态成像条件和针头可视化的困难。已有许多方法被提出用于自动化针头插入,但它们通常依赖于手工设计的管道和模块化控制器,其性能在复杂情况下会下降。本文提出了一种视觉-语言-动作(VLA)模型,用于在机器人超声(RUS)系统上实现自适应和自动化的超声引导针头插入与跟踪。该框架为针头跟踪和针头插入控制提供了一种统一的方法,能够根据获取的针头位置和环境感知,实时、动态地自适应调整插入过程。为了实现实时和端到端的跟踪,我们提出了一种跨深度融合(CDF)跟踪头,它整合了来自大规模视觉骨干网络的浅层位置特征和深层语义特征。为了使预训练的视觉骨干网络适应跟踪任务,我们引入了一种跟踪条件(TraCon)寄存器,用于参数高效的特征调节。在针头跟踪之后,我们提出了一种不确定性感知的控制策略和一个异步 VLA 管道,用于自适应针头插入控制,确保及时决策以提高安全性和结果。在针头跟踪和插入方面的大量实验表明,我们的方法始终优于最先进的跟踪器和手动操作,实现了更高的跟踪精度、更高的插入成功率和更短的操作时间,为基于 RUS 的智能介入指明了有前景的方向。
引用
@article{arxiv.2604.20347,
title = {A Vision-Language-Action Model for Adaptive Ultrasound-Guided Needle Insertion and Needle Tracking},
author = {Yuelin Zhang and Qingpeng Ding and Longxiang Tang and Chengyu Fang and Shing Shin Cheng},
journal= {arXiv preprint arXiv:2604.20347},
year = {2026}
}
备注
Accepted by ICRA 2026