Auto MC-Reward:利用大型语言模型为 Minecraft 自动化设计密集奖励
人工智能
2024-04-02 v2 计算与语言
计算机视觉与模式识别
机器学习
摘要
许多强化学习环境(例如 Minecraft)仅提供稀疏奖励,即用二元值指示任务完成或失败。此类环境中探索效率的挑战使得基于强化学习的智能体难以学习复杂任务。为此,本文介绍了一种名为 Auto MC-Reward 的高级学习系统,该系统利用大型语言模型(LLMs)自动设计密集奖励函数,从而提高学习效率。Auto MC-Reward 由三个重要组件组成:奖励设计器(Reward Designer)、奖励评论家(Reward Critic)和轨迹分析器(Trajectory Analyzer)。给定环境信息和任务描述,奖励设计器首先通过编写具有预定义观测输入的executable Python 函数来设计奖励函数。然后,我们的奖励评论家负责验证代码,检查代码是否自洽且无语法和语义错误。此外,轨迹分析器根据收集的轨迹总结可能的失败原因并提供改进建议。在下一轮中,奖励设计器将基于反馈进一步细化和迭代密集奖励函数。实验表明,我们的智能体在 Minecraft 复杂任务中的成功率和学习效率显著提高,例如在具备有效避开熔岩能力的同时获取钻石,以及在平原生物群系中有效探索稀疏的树木和动物。
引用
@article{arxiv.2312.09238,
title = {Auto MC-Reward: Automated Dense Reward Design with Large Language Models for Minecraft},
author = {Hao Li and Xue Yang and Zhaokai Wang and Xizhou Zhu and Jie Zhou and Yu Qiao and Xiaogang Wang and Hongsheng Li and Lewei Lu and Jifeng Dai},
journal= {arXiv preprint arXiv:2312.09238},
year = {2024}
}
备注
Accepted by CVPR2024