中文

从法则到动机:通过基于法则的推理与奖励指导探索

机器学习 2024-11-26 v1

摘要

大型语言模型 (LLM) 和强化学习 (RL) 是构建自主代理人的两个强大方法。然而,由于对游戏环境的有限理解,代理人常常会采用低效的探索和试错,难以制定长期策略或做出决策。我们提出一种方法,从交互记录中提取经验来建模游戏环境的底层法则,将这些经验作为内部动机来指导代理人。这些以语言表达的经验高度灵活,可以直接帮助代理人进行推理,或转化为奖励以指导训练。我们的评估结果表明,在 Crafter 环境中,RL 和 LLM 代理人都受益于这些经验,表现得到改善。

关键词

引用

@article{arxiv.2411.15891,
  title  = {From Laws to Motivation: Guiding Exploration through Law-Based Reasoning and Rewards},
  author = {Ziyu Chen and Zhiqing Xiao and Xinbei Jiang and Junbo Zhao},
  journal= {arXiv preprint arXiv:2411.15891},
  year   = {2024}
}