中文

利用 LLM 反馈进行强化学习以对抗目标误泛化

机器学习 2024-01-17 v1

摘要

我们引入一种方法,利用训练期间的大语言模型(LLM)反馈来解决强化学习(RL)中的目标误泛化问题。目标误泛化是 RL 中的一种鲁棒性失效类型,发生在智能体在分布外仍保留其能力,但追求的是代理目标而非预期目标时。我们的方法利用 LLM 分析 RL 智能体在训练期间的策略,并识别潜在的失效场景。随后,RL 智能体被部署到这些场景中,并通过 LLM 的偏好和反馈学习一个奖励模型。这个由 LLM 信息驱动的奖励模型被用于在原始数据集上进一步训练 RL 智能体。我们将该方法应用于迷宫导航任务,结果显示在目标泛化方面有显著改进,尤其是在真实目标与代理目标有一定可区分性且行为偏差明显的情况下。本研究表明,尽管 LLM 缺乏任务熟练度,但它能高效监督 RL 智能体,为通过使用 LLM 增强 RL 中的目标导向学习提供了可扩展的监督和有价值的见解。

关键词

引用

@article{arxiv.2401.07181,
  title  = {Reinforcement Learning from LLM Feedback to Counteract Goal Misgeneralization},
  author = {Houda Nait El Barj and Theophile Sautory},
  journal= {arXiv preprint arXiv:2401.07181},
  year   = {2024}
}