HackAtari:用于鲁棒与持续强化学习的 Atari 学习环境
人工智能
2024-06-07 v1 机器学习
摘要
人工智能代理的适应性和与预期行为的一致性对于其有效部署至关重要。强化学习(RL)利用新奇性作为探索手段,但代理往往难以处理新情境,限制了泛化能力。为此,本文提出HackAtari框架,向最常用的RL基准——Atari学习环境中引入受控新奇性。HackAtari允许我们创建新游戏情境(包括简化用于课程学习),交换游戏元素颜色,以及引入不同的奖励信号。我们展示,当前训练于原始环境的代理包含鲁棒性缺陷,并通过使用C51和PPO实验评估HackAtari在增强RL代理鲁棒性和行为一致性方面的效果。总体而言,HackAtari可用于改进当前和未来RL算法的鲁棒性,支持神经符号RL、课程RL、因果RL以及LLM驱动的RL。本工作强调了开发RL代理可解释性的重要性。
引用
@article{arxiv.2406.03997,
title = {HackAtari: Atari Learning Environments for Robust and Continual Reinforcement Learning},
author = {Quentin Delfosse and Jannis Blüml and Bjarne Gregori and Kristian Kersting},
journal= {arXiv preprint arXiv:2406.03997},
year = {2024}
}
备注
9 main pages, 4 pages references, 19 pages of appendix