阅读并收获回报:借助说明书学习玩 Atari 游戏
机器学习
2024-07-23 v4 人工智能
计算与语言
摘要
高样本复杂度长期以来都是强化学习(RL)的一大挑战。另一方面,人类不仅通过交互或示范,还通过阅读非结构化文本文档(例如说明书)来学习执行任务。说明书与维基页面是可用于告知智能体有价值特征与策略或任务特定环境动态及奖励结构的最丰富数据之一。因此,我们假设,利用人类书写的说明书辅助学习特定任务策略的能力,应能带来更高效且表现更优的智能体。我们提出 Read and Reward 框架。该框架通过阅读 Atari 游戏开发者发布的说明书,加速 Atari 游戏上的 RL 算法。我们的框架由一个从说明书中提取并总结相关信息的问答提取模块,以及一个基于说明书信息评估物体–智能体交互的推理模块组成。当检测到交互时,向标准 A2C RL 智能体提供辅助奖励。实验上,多种 RL 算法在我们的设计辅助下于性能与训练速度上均获得显著提升。
引用
@article{arxiv.2302.04449,
title = {Read and Reap the Rewards: Learning to Play Atari with the Help of Instruction Manuals},
author = {Yue Wu and Yewen Fan and Paul Pu Liang and Amos Azaria and Yuanzhi Li and Tom M. Mitchell},
journal= {arXiv preprint arXiv:2302.04449},
year = {2024}
}