应用于交互式小说的深度强化学习算法改进
人工智能
2019-12-02 v1 机器学习
摘要
基于文本的游戏是深度强化学习算法的天然挑战领域。其状态与动作空间组合性巨大,奖励函数稀疏,且为部分可观测:智能体通过文本反馈获知动作后果。本文强调后者,并考虑设计能从纯反馈中游玩的深度强化学习智能体。我们的设计认识并利用基于文本游戏的结构特性。我们首先提出一种基于累积奖励的情境化机制,简化学习问题并缓解部分可观测性。随后研究不同方法,其依赖于任一给定情形下大多数动作无效的思想,遵循 Zahavy 等人关于可容许动作的观点。我们在基于 TextWorld 框架的一系列难度递增的基于文本游戏以及经典游戏 Zork 中评估这些技术。经验上,我们发现这些技术提升了应用于基于文本游戏的基线深度强化学习智能体的性能。
引用
@article{arxiv.1911.12511,
title = {Algorithmic Improvements for Deep Reinforcement Learning applied to Interactive Fiction},
author = {Vishal Jain and William Fedus and Hugo Larochelle and Doina Precup and Marc G. Bellemare},
journal= {arXiv preprint arXiv:1911.12511},
year = {2019}
}
备注
To appear in Proceedings of the Thirty-Fourth AAAI Conference on Artificial Intelligence (AAAI-20). Accepted for Oral presentation