自然语言强化学习
计算与语言
2024-02-16 v2 人工智能
机器学习
摘要
强化学习(RL)在学习决策任务的策略方面展现出惊人的能力。然而,RL常受限于样本效率低、缺乏可解释性以及稀疏监督信号等问题。为克服这些限制,我们借鉴人类学习过程,提出一种名为自然语言强化学习(NLRL)的新方法,创新性地将RL原理与自然语言表示相结合。具体而言,NLRL在自然语言空间重新定义了任务目标、策略、价值函数、贝尔曼方程和策略迭代等RL概念。我们展示了如何通过最新的大语言模型(LLM)进展(如GPT-4)实现NLRL。初始实验表明,NLRL框架在表格型MDP任务上在有效性、效率和可解释性方面均表现出色。
引用
@article{arxiv.2402.07157,
title = {Natural Language Reinforcement Learning},
author = {Xidong Feng and Ziyu Wan and Mengyue Yang and Ziyan Wang and Girish A. Koushik and Yali Du and Ying Wen and Jun Wang},
journal= {arXiv preprint arXiv:2402.07157},
year = {2024}
}
备注
Work in Progress