在开放世界中学习课程
人工智能
2023-12-11 v2 机器学习
摘要
深度强化学习(RL)为训练最优的序列决策智能体提供了强大的方法。由于收集真实世界的交互可能会带来额外的成本和安全风险,sim2real 的常见范式是在模拟器中进行训练,随后部署到真实世界。不幸的是,RL 智能体很容易过拟合于模拟训练环境的选择,更糟的是,当智能体掌握了特定的一组模拟环境后,学习就会结束。相比之下,真实世界是高度开放的,具有不断演化的环境和挑战,这使得此类 RL 方法不适用。简单地随机化模拟环境是不够的,因为它需要做出任意的分布假设,并且在组合上不太可能采样到对学习有用的特定环境实例。理想的学习过程应该自动调整训练环境,以在匹配或超越真实世界复杂性的开放任务空间中最大化智能体的学习潜力。本论文发展了一类称为无监督环境设计(UED)的方法,旨在产生此类开放过程。给定一个环境设计空间,UED 自动生成处于学习智能体能力边界的无限训练环境序列或课程。通过基于极小极大遗憾决策理论和博弈论的广泛实证研究和理论论证,本论文的发现表明,UED 自动课程可以产生对未见环境实例表现出显著增强的鲁棒性和泛化能力的 RL 智能体。此类自动课程是通向开放式学习系统的有希望的路径,这些系统通过不断生成并掌握自身设计的额外挑战来实现更通用的智能。
引用
@article{arxiv.2312.03126,
title = {Learning Curricula in Open-Ended Worlds},
author = {Minqi Jiang},
journal= {arXiv preprint arXiv:2312.03126},
year = {2023}
}
备注
PhD dissertation