中文

Phoenix:一种基于运动的自省框架用于精细机器人动作校正

机器人学 2025-04-22 v1 人工智能 计算机视觉与模式识别

摘要

构建可从容错中恢复的通用自校正系统对机器人至关重要。尽管多模态大语言模型(MLLM)已取得进展,赋予机器人语义反思能力,但将语义反思转化为如何校正细粒度机器人动作仍是显著挑战。为解决这一差距,我们构建了 Phoenix 框架,利用运动指令作为连接高级语义反思与低级机器人动作校正的桥梁。在该运动自省框架中,我们采用 MLLM 实现双进程运动调整机制,将语义反思转化为粗粒度运动指令调整。为利用此运动指令引导如何校正细粒度机器人动作,提出一种多任务运动条件扩散策略,集成视觉观测以实现高频率机器人动作校正。通过将这两个模型结合起来,可将泛化能力的需求从低级操控策略转移到 MLLM 驱动的运动调整模型中,从而促进精确、细粒度的机器人动作校正。利用该框架,我们进一步开发了一种终身学习方法,以自动提高模型在与动态环境交互中的能力。在 RoboMimic 仿真和真实场景中的实验表明,我们的框架在各种操控任务中具备优异的泛化性和鲁棒性。我们的代码已发布于 https://github.com/GeWu-Lab/Motion-based-Self-Reflection-Framework。

关键词

引用

@article{arxiv.2504.14588,
  title  = {Phoenix: A Motion-based Self-Reflection Framework for Fine-grained Robotic Action Correction},
  author = {Wenke Xia and Ruoxuan Feng and Dong Wang and Di Hu},
  journal= {arXiv preprint arXiv:2504.14588},
  year   = {2025}
}

备注

Accepted by CVPR2025