基于抽象前向模型与迁移学习的星际争霸高效强化学习
机器学习
2021-11-03 v4 人工智能
机器学习
摘要
注入人类知识是加速强化学习(RL)的一种有效方式。然而,这些方法尚未得到充分探索。本文提出我们的发现:抽象前向模型(思维博弈(TG))结合迁移学习(TL)是一种有效途径。我们以《星际争霸 II》为研究环境。在设计的 TG 的帮助下,智能体仅用单台商用机器 1.08 小时即可在 64x64 地图上以 99% 的胜率击败 7 级内置 AI。我们还表明,TG 方法并不像此前认为的那样受限。它可以与粗略设计的 TG 协同工作,并且在环境发生变化时同样有用。与以往的基于模型的 RL 相比,我们证明 TG 更为有效。我们还提出一个 TG 假设,给出 TG 不同保真度水平的影响。对于状态与动作空间不等的真实游戏,我们提出了一种新颖的 XfrNet,其实用性在取得对抗作弊 10 级 AI 的 90% 胜率时得到验证。我们认为,TG 方法可能为借助人类知识进行高效 RL 的进一步研究提供启示。
引用
@article{arxiv.1903.00715,
title = {Efficient Reinforcement Learning for StarCraft by Abstract Forward Models and Transfer Learning},
author = {Ruo-Ze Liu and Haifeng Guo and Xiaozhong Ji and Yang Yu and Zhen-Jia Pang and Zitai Xiao and Yuzhou Wu and Tong Lu},
journal= {arXiv preprint arXiv:1903.00715},
year = {2021}
}