丰富环境中运动行为的涌现
人工智能
2017-07-12 v2
摘要
强化学习范式原则上允许直接从简单的奖励信号中学习复杂行为。然而在实践中,通常会精心手工设计奖励函数以鼓励特定解,或从其演示数据中推导。本文探讨丰富的环境如何有助于促进复杂行为的学习。具体地,我们在多样化的环境背景下训练智能体,发现这促使了在一系列任务上表现良好的鲁棒行为的涌现。我们以运动行为——已知其对奖励选择敏感的行为——来证明该原理。我们使用基于前进进度的简单奖励函数,在多样且具有挑战性的地形和障碍物上训练多个模拟身体。利用一种新颖的可扩展策略梯度强化学习变体,我们的智能体学会了根据环境要求奔跑、跳跃、蹲伏和转向,而无需基于奖励的明确引导。所学行为亮点的可视化展示可访问 https://youtu.be/hx_bgoTF7bs 。
引用
@article{arxiv.1707.02286,
title = {Emergence of Locomotion Behaviours in Rich Environments},
author = {Nicolas Heess and Dhruva TB and Srinivasan Sriram and Jay Lemmon and Josh Merel and Greg Wayne and Yuval Tassa and Tom Erez and Ziyu Wang and S. M. Ali Eslami and Martin Riedmiller and David Silver},
journal= {arXiv preprint arXiv:1707.02286},
year = {2017}
}