SAGA:基于结构化 affordance grounding 的开放世界移动操作
机器人学
2025-12-16 v1 人工智能
机器学习
摘要
我们提出了 SAGA,一个灵活且自适应的视觉运动控制框架,可跨越各种环境、任务目标和用户规范进行推理。为了高效学习此类能力,我们的关键思想是通过显式地将任务目标锚定在观察到的环境中,来分离高层语义意图与低层视觉运动控制。通过基于 affordance 的任务表示,SAGA 将多样且复杂的行为以统一、结构化的形式表达。利用多模态基础模型,SAGA 将提出的任务表示锚定于机器人的视觉观察中,生成为 3D affordance 热力图,突出任务相关实体,同时抽象掉会阻碍泛化的无关外观变化。这些锚定好的 affordance 使我们能够有效地在多任务演示数据上训练条件策略,以实现全身控制。在统一的框架中,SAGA 可以解决以不同形式指定的任务,包括语言指令、选定点和示例演示,实现零样本执行和少样本适应。我们在四足操作机器人上实现 SAGA,并在 11 个真实世界任务上进行了大量实验。SAGA 在实验中持续地超过端到端和模块化基线,获得显著的优势。正是由于这些结果,表明结构化 affordance grounding 提供了通用移动操作的可扩展且有效的路径。
引用
@article{arxiv.2512.12842,
title = {SAGA: Open-World Mobile Manipulation via Structured Affordance Grounding},
author = {Kuan Fang and Yuxin Chen and Xinghao Zhu and Farzad Niroui and Lingfeng Sun and Jiuguang Wang},
journal= {arXiv preprint arXiv:2512.12842},
year = {2025}
}
备注
9 pages, 7 figures