Avalon:一个使用程序生成世界研究强化学习泛化的基准
人工智能
2022-10-25 v1 机器学习
摘要
尽管取得了令人瞩目的成功,深度强化学习(RL)系统在泛化到与其训练不同的新任务和环境时仍不及人类表现。作为一个专为研究 RL 泛化而设计的基准,我们引入了 Avalon,这是一组任务,其中具身智能体在高度多样的程序生成 3D 世界中必须通过地形导航、狩猎或采集食物以及避开危险来生存。Avalon 在现有 RL 基准中独树一帜:每个任务的奖励函数、世界动态和动作空间都相同,仅通过更改环境来区分任务;其 20 个任务复杂度从吃到和投掷到狩猎和导航不等,每个任务都创造出智能体必须施展特定技能才能生存的世界。该设置支持对任务内、任务间以及需要组合从先前任务所学技能的复合任务泛化进行研究。Avalon 包含一个高效模拟器、一组基线库以及一个根据数百小时人类表现评估的带评分指标的基准,所有这些均为开源且公开可用。我们发现标准 RL 基线在大多数任务上取得进展,但仍远不及人类表现,这表明 Avalon 具有足够挑战性以推动对可泛化 RL 的探索。
引用
@article{arxiv.2210.13417,
title = {Avalon: A Benchmark for RL Generalization Using Procedurally Generated Worlds},
author = {Joshua Albrecht and Abraham J. Fetterman and Bryden Fogelman and Ellie Kitanidis and Bartosz Wróblewski and Nicole Seo and Michael Rosenthal and Maksis Knutins and Zachary Polizzi and James B. Simon and Kanjun Qiu},
journal= {arXiv preprint arXiv:2210.13417},
year = {2022}
}
备注
Accepted to NeurIPS Datasets and Benchmarks 2022. Video and links to all code, data, etc can be found at https://generallyintelligent.com/avalon/