STARLING:基于大语言模型的文本型强化学习智能体自监督训练
机器学习
2024-06-11 v1 人工智能
计算与语言
摘要
交互式小说游戏近年来成为提高语言型强化学习 (RL) 智能体泛化能力的重要应用领域。现有的交互式小说游戏环境要么是特定于领域的,要么需要大量时间来生成,且无法训练 RL 智能体掌握特定的一组技能。本文介绍了一种用于自监督 RL 的交互式环境——STARLING——用于文本游戏,该环境基于自动生成的游戏(基于一组游戏构想的种子)来提升性能和泛化能力,以实现对目标环境目标的达成。这些游戏让智能体在预定义的一组任务上磨练技能。我们创建并测试了一个包含 100 个游戏的数据环境,该环境使用自动化框架生成,框架基于大语言模型 (GPT-3) 和基于 Inform7 的交互式小说游戏引擎,使用户能够在最小的人工监督下生成更多游戏。基于人类参与者和基线文本型 RL 智能体的实验结果表明,当前的状态-of-the-art 文本型 RL 智能体无法像人类一样在新情境中运用先前学习的技能。这些结果凸显了 STARLING 作为自监督文本型 RL 进一步研究的沙箱环境的潜力。
引用
@article{arxiv.2406.05872,
title = {STARLING: Self-supervised Training of Text-based Reinforcement Learning Agent with Large Language Models},
author = {Shreyas Basavatia and Keerthiram Murugesan and Shivam Ratnakar},
journal= {arXiv preprint arXiv:2406.05872},
year = {2024}
}
备注
ACL 2024 (Findings)