OmniGuide:用于增强通用机器人策略的通用指导场
机器人学
2026-03-12 v1 机器学习
摘要
视觉语言-动作(VLA)模型在解决大范围相对简单任务方面显示出巨大的潜力。然而,它们在更复杂的任务上表现有限,这些任务需要复杂的空间或语义理解、拥挤环境中的操作,或精确操作。我们提出 OMNIGUIDE,一种灵活的框架,通过利用任意来源的指导(如 3D foundation 模型、语义推理 VLM 和人体姿态模型)来提高 VLA 在此类任务上的性能。我们展示了各种形式的指导如何自然地表示为具有特定吸引力和排斥力定位于 3D 空间中,可影响 VLA 动作的采样。在这种方式下,OMNIGUIDE 使能够从 complementary task-relevant 优势的指导来源能够提高 VLA 模型在具有挑战性的任务上的性能。在 simulation 和 real-world 环境中进行大量实验,跨越多种指导来源,表明 OMNIGUIDE 在 state-of-the-art 通用策略(如 、GR00T N1.6)的成功率和安全性方面显著提升。关键的是,我们的统一框架匹配或超越了旨在将特定指导来源整合到 VLA 策略中的先前方法。项目页面: $\href{https://omniguide.github.io/}{this \; url}
引用
@article{arxiv.2603.10052,
title = {OmniGuide: Universal Guidance Fields for Enhancing Generalist Robot Policies},
author = {Yunzhou Song and Long Le and Yong-Hyun Park and Jie Wang and Junyao Shi and Lingjie Liu and Jiatao Gu and Eric Eaton and Dinesh Jayaraman and Kostas Daniilidis},
journal= {arXiv preprint arXiv:2603.10052},
year = {2026}
}
备注
Project Page: $\href{https://omniguide.github.io/}{this\; url}$