中文

VENTURA:适配图像扩散模型以实现统一任务条件化导航

机器人学 2025-10-03 v1 计算机视觉与模式识别

摘要

机器人必须适应多样化的人类指令,并在非结构化的开放世界环境中安全运行。最近的视觉-语言模型 (VLMs) 为语言和感知的接地提供了强大的先验,但由于动作空间和预训练目标的差异,阻碍了其向机器人任务的迁移,因此仍然难以用于导航控制。为了解决这一问题,我们引入了 VENTURA,这是一个视觉-语言导航系统,它对互联网预训练的图像扩散模型进行微调以进行路径规划。VENTURA 不直接预测低级动作,而是在图像空间中生成一个路径掩码(即视觉规划),以捕捉细粒度的、上下文感知的导航行为。一个轻量级的模仿学习策略将这些视觉规划接地为可执行的轨迹,产生了一个遵循自然语言指令以生成多样化机器人行为的接口。为了扩大训练规模,我们利用自监督跟踪模型导出的路径掩码并配以 VLM 增强的字幕进行监督,避免了人工像素级标注或高度工程化的数据收集设置。在广泛的真实世界评估中,VENTURA 在物体到达、避障和地形偏好任务上优于最先进的基础模型基线,在已见和未见场景中均将成功率提高了 33%,并将碰撞减少了 54%。值得注意的是,我们发现 VENTURA 能够泛化到不同任务的未见组合,展现出涌现的组合能力。视频、代码和补充材料:https://venturapath.github.io

关键词

引用

@article{arxiv.2510.01388,
  title  = {VENTURA: Adapting Image Diffusion Models for Unified Task Conditioned Navigation},
  author = {Arthur Zhang and Xiangyun Meng and Luca Calliari and Dong-Ki Kim and Shayegan Omidshafiei and Joydeep Biswas and Ali Agha and Amirreza Shaban},
  journal= {arXiv preprint arXiv:2510.01388},
  year   = {2025}
}

备注

9 pages, 6 figures, 3 tables