STRIDE:自动化人oid机器人 locomotion 任务中的奖励设计、深度强化学习训练与反馈优化
机器人学
2025-02-13 v3 机器学习
摘要
人oid机器人在人工智能领域面临着重大挑战,需要精确协调和控制高自由度系统。为深度强化学习(DRL)设计有效的奖励函数仍是关键瓶颈,要求大量手动工作、专业知识和迭代细化。为克服这些挑战,我们引入STRIDE,一个基于agentic engineering的新型框架,用于自动化奖励设计、DRL训练和反馈优化,专注于人oid机器人的 locomotion 任务。通过将agentic engineering的结构原则与大语言模型(LLM)结合,用于代码生成、零样本生成和情境优化,STRIDE能够在不依赖任务特定提示或模板的情况下生成、评估和迭代细化奖励函数。跨多种环境(包括各种人oid机器人形态)的实验表明,STRIDE超越了最先进的奖励设计框架EUREKA,平均实现约250%的效率和任务性能提升。使用STRIDE生成的奖励函数,模拟的人oid机器人能够在复杂地形上实现 sprint 级 locomotion,凸显了其在推动DRL工作流程和人oid机器人研究方面的潜力。
引用
@article{arxiv.2502.04692,
title = {STRIDE: Automating Reward Design, Deep Reinforcement Learning Training and Feedback Optimization in Humanoid Robotics Locomotion},
author = {Zhenwei Wu and Jinxiong Lu and Yuxiao Chen and Yunxin Liu and Yueting Zhuang and Luhui Hu},
journal= {arXiv preprint arXiv:2502.04692},
year = {2025}
}