中文

MoRE:释放四足视觉-语言-动作模型强化学习的可扩展性

机器人学 2025-03-12 v1 人工智能

摘要

开发能够在真实世界环境中流畅执行各种动作和任务的多功能四足机器人仍然是一项重大挑战。本文提出了一种用于四足机器人的新型视觉-语言-动作(VLA)模型——机器人专家混合,旨在引入强化学习(RL),利用大量混合质量数据微调大规模 VLA 模型。MoRE 在密集型多模态大语言模型(MLLM)中集成了多个低秩适应模块作为不同的专家,构成了稀疏激活的混合专家模型。这种设计使模型能够有效适应各种下游任务。此外,在深入探索任务结构特性后,我们采用基于强化学习的训练目标将模型训练为 Q 函数。从自动收集的混合质量数据中进行有效学习,提高了数据效率和模型性能。大量实验表明,MoRE 在六种不同技能上均优于所有基线方法,并在分布外场景中展现出卓越的泛化能力。我们进一步在真实世界场景中验证了该方法,证实了其实用性,为未来四足机器人多任务学习研究奠定了坚实基础。

关键词

引用

@article{arxiv.2503.08007,
  title  = {MoRE: Unlocking Scalability in Reinforcement Learning for Quadruped Vision-Language-Action Models},
  author = {Han Zhao and Wenxuan Song and Donglin Wang and Xinyang Tong and Pengxiang Ding and Xuelian Cheng and Zongyuan Ge},
  journal= {arXiv preprint arXiv:2503.08007},
  year   = {2025}
}

备注

Accepted by ICRA 2025