Game On:语言模型作为强化学习实验者
人工智能
2024-09-06 v1 机器人学
摘要
我们提出了一种代理体系结构,自动化常见的强化学习实验工作流程的一部分,以实现对具身智能体的控制领域进行自动化掌握。为此,我们利用 VLM 执行一些通常需要人类实验者完成的功能,包括监控和分析实验进度、基于智能体过去的成功与失败提出新任务、将任务分解为子任务序列(技能),以及检索要执行的技能,从而实现自动化课程的构建。我们认为这是首个在整个强化学习实验周期中利用 VLM 的系统性提议之一。我们提供了一个原型系统,检验当前模型和技术是否具备所需的自动化水平。为此,我们使用标准的 Gemini 模型,无需额外微调,为语言条件化 Actor-Critic 算法提供一套技能课程,以引导数据收集,以帮助学习新技能。我们展示的以这种方式收集的数据对在机器人领域学习和迭代改进控制策略具有用处。此外,对系统构建技能库以及判断训练这些技能进度的能力的进一步检查也显示出有前景的成果,表明所提出的体系结构为具身智能体在任务和领域上实现完全自动化掌握提供了潜在的配方。
引用
@article{arxiv.2409.03402,
title = {Game On: Towards Language Models as RL Experimenters},
author = {Jingwei Zhang and Thomas Lampe and Abbas Abdolmaleki and Jost Tobias Springenberg and Martin Riedmiller},
journal= {arXiv preprint arXiv:2409.03402},
year = {2024}
}