Eureka:通过编程大型语言模型实现人类水平的奖励设计
机器人学
2024-05-02 v2 人工智能
机器学习
摘要
大型语言模型(LLMs)作为序贯决策任务的高层语义规划器表现出色。然而,利用它们学习复杂的底层操作任务,如灵巧转笔,仍是一个开放问题。我们弥合这一根本差距,提出 Eureka,一种由 LLM 驱动的人类水平奖励设计算法。Eureka 利用最先进 LLM(如 GPT-4)卓越的零样本生成、代码编写与上下文改进能力,对奖励代码进行进化优化。所得奖励随后可用于通过强化学习习得复杂技能。在没有任何任务特定提示或预定义奖励模板的情况下,Eureka 生成的奖励函数优于专家人工设计的奖励。在包含 10 种不同机器人形态、共 29 个开源 RL 环境的多样化套件中,Eureka 在 83% 的任务上超越人类专家,平均归一化提升达 52%。Eureka 的通用性还实现了一种全新的无梯度上下文学习式人类反馈强化学习(RLHF)方法,可便捷地融入人类输入以提升生成奖励的质量与安全性,而无需模型更新。最后,在课程学习设置中使用 Eureka 奖励,我们首次展示了能够执行转笔技巧的模拟 Shadow Hand,可快速绕圈灵巧操控一支笔。
引用
@article{arxiv.2310.12931,
title = {Eureka: Human-Level Reward Design via Coding Large Language Models},
author = {Yecheng Jason Ma and William Liang and Guanzhi Wang and De-An Huang and Osbert Bastani and Dinesh Jayaraman and Yuke Zhu and Linxi Fan and Anima Anandkumar},
journal= {arXiv preprint arXiv:2310.12931},
year = {2024}
}
备注
ICLR 2024. Project website and open-source code: https://eureka-research.github.io/