Motif: 来自人工智能反馈的内在动机
人工智能
2023-10-03 v1 机器学习
摘要
在缺乏先验知识的情况下探索丰富环境并评估自身动作极具挑战性。本文中,我们提出 Motif,一种将大语言模型(LLM)的此类先验知识与智能体对接的通用方法。Motif 基于这样一种思路:在不要求 LLM 与环境交互的情况下将其接地用于决策——它从 LLM 对成对描述的偏好中获取反馈,构建内在奖励,随后用于通过强化学习训练智能体。我们在具有挑战性、开放且程序化生成的 NetHack 游戏上评估 Motif 的性能与行为。令人惊讶的是,仅通过学习最大化其内在奖励,Motif 取得了比直接训练以最大化分数本身的算法更高的游戏分数。将 Motif 的内在奖励与环境奖励结合后,我们的方法显著优于现有方法,并在无演示情况下从未取得进展的任务上有所突破。最后,我们展示 Motif 大多生成直观的、与人类对齐的行为,可通过提示修改轻松引导,且随 LLM 规模与提示中给定信息量的扩展表现良好。
引用
@article{arxiv.2310.00166,
title = {Motif: Intrinsic Motivation from Artificial Intelligence Feedback},
author = {Martin Klissarov and Pierluca D'Oro and Shagun Sodhani and Roberta Raileanu and Pierre-Luc Bacon and Pascal Vincent and Amy Zhang and Mikael Henaff},
journal= {arXiv preprint arXiv:2310.00166},
year = {2023}
}
备注
The first two authors equally contributed - order decided by coin flip