中文

CapsDT:用于胶囊机器人操作的扩散-Transformer 模型

机器人学 2025-06-23 v1 人工智能

摘要

视觉-语言-动作 (VLA) 模型近年来成为备受关注的研究领域,在多种应用中展现出巨大的潜力。然而,这些模型在内镜机器人领域的应用尚未得到充分探索,尤其是用于胶囊机器人(在消化系统内执行动作的机器人)的应用。将 VLA 模型集成到内镜机器人中,能够实现更直观、更高效的人机交互,从而提升诊断准确性和治疗效果。在本工作中,我们设计了 CapsDT,这是一个用于胃部胶囊机器人操作的扩散 Transformer 模型。CapsDT 通过处理交错的视觉输入和文本指令,推断出相应的机器人控制信号,以促进内镜任务。在此基础上,我们开发了一个胶囊内镜机器人系统,利用由机械臂持有的磁铁控制胶囊机器人,实现了四类内镜任务的不同难度水平,并在胃部模拟器中创建了相应的胶囊机器人数据集。对各种机器人任务进行的全面评估表明,CapsDT 可作为稳健的视觉-语言通用模型,实现了在各种难度水平的内镜任务中的最先进性能,并在实际世界模拟操作中实现了 26.25% 的成功率。

关键词

引用

@article{arxiv.2506.16263,
  title  = {CapsDT: Diffusion-Transformer for Capsule Robot Manipulation},
  author = {Xiting He and Mingwu Su and Xinqi Jiang and Long Bai and Jiewen Lai and Hongliang Ren},
  journal= {arXiv preprint arXiv:2506.16263},
  year   = {2025}
}

备注

IROS 2025