面向决策智能体的在线内在奖励:来自大语言模型反馈
机器学习
2025-10-27 v4 人工智能
计算与语言
机器人学
摘要
从自然语言描述自动合成稠密奖励是强化学习(RL)中一个有前景的范式,适用于稀疏奖励问题、开放式探索和层次化技能设计。最近的研究通过利用大语言模型(LLM)的先验知识取得了有希望的进展。然而,这些方法存在重要局限:要么由于需要为每个观察值进行LLM标注,难以扩展到需要数十亿环境样本的问题;要么需要多样化的离线数据集,而这可能不存在或不可能收集。在本工作中,我们通过算法和系统层面的结合,针对这些局限提出了解决方案。我们提出了ONI(Online Intrinsic Rewards),一种分布式架构,同时学习RL策略和基于LLM反馈的内在奖励函数。我们的 approach 通过异步LLM服务器标注智能体收集的经验,然后将其蒸馛为内在奖励模型。我们探索了多种奖励建模算法选择,包括哈希、分类和排序模型。我们的 method 在来自 NetHack 学习环境的各种具有挑战性的任务上实现了最新进展,同时消除了先前研究所需的大规模离线数据集。我们在 https://github.com/facebookresearch/oni 公开代码。
关键词
引用
@article{arxiv.2410.23022,
title = {Online Intrinsic Rewards for Decision Making Agents from Large Language Model Feedback},
author = {Qinqing Zheng and Mikael Henaff and Amy Zhang and Aditya Grover and Brandon Amos},
journal= {arXiv preprint arXiv:2410.23022},
year = {2025}
}
备注
RLC 2025