中文

评估 LLM 在 RL 中的零样本行动评估能力

机器学习 2024-09-20 v1 人工智能

摘要

时间信用分配问题是强化学习 (RL) 中的核心挑战,关乎对每个动作在轨迹中对实现目标能力的适当影响进行归因。然而,当反馈延迟且稀疏时,学习信号较差,动作评估变得更加困难。规范解决方案,如奖励塑形和选项方法,要求大量领域知识和手动干预,限制了其可扩展性和适用性。在本 work 中,我们为 Credit Assignment with Language Models (CALM) 奠定了基础,这是一种新方法,利用大型语言模型 (LLM) 通过奖励塑形和选项发现自动化信用分配的技术。CALM 使用 LLM 将任务分解为 elementary subgoals 并评估这些 subgoals 在 state-action 转换中的实现情况。每当一个 option 终止时,一个 subgoal 被实现,CALM 提供一个辅助奖励。当任务奖励稀疏且延迟时,这些额外的奖励信号可以在不需要人类设计奖励的情况下增强学习过程。我们使用来自 MiniHack 的人工标注演示数据集对 CALM 进行了初步评估,表明 LLM 在零样本设置下能够有效地进行信用分配,且无需示例或 LLM 微调。我们的初步结果表明,LLM 的知识是 RL 信用分配的有前景的先验,促进了人类知识向价值函数的传递。

关键词

引用

@article{arxiv.2409.12798,
  title  = {Assessing the Zero-Shot Capabilities of LLMs for Action Evaluation in RL},
  author = {Eduardo Pignatelli and Johan Ferret and Tim Rockäschel and Edward Grefenstette and Davide Paglieri and Samuel Coward and Laura Toni},
  journal= {arXiv preprint arXiv:2409.12798},
  year   = {2024}
}

备注

9 pages