元强化学习任务的过程式生成
机器学习
2023-12-12 v2 人工智能
摘要
开放性有望受益于生成无限多样的、多样的、具挑战性的环境的能力。一类尤其有趣的挑战是元学习(“学会学习”),它是智能行为的标志。然而,文献中元学习环境的数量有限。在此我们描述一个带任意刺激的简单元强化学习(meta-RL)任务的参数化空间。该参数化允许我们随机生成任意数量的新型简单元学习任务。该参数化具有足够表达能力以涵盖许多知名 meta-RL 任务,如 bandit 问题、Harlow 任务、T-迷宫、Daw 两步任务及其他。简单扩展使其能捕获基于二维拓扑空间的任务,如完整迷宫或找点域。我们描述了一些随机生成的、复杂度各异的 meta-RL 域,并讨论随机生成引发的潜在问题。
引用
@article{arxiv.2302.05583,
title = {Procedural generation of meta-reinforcement learning tasks},
author = {Thomas Miconi},
journal= {arXiv preprint arXiv:2302.05583},
year = {2023}
}
备注
Agent Learning in Open-Endedness (ALOE) Workshop at NeurIPS 2023