中文

通过形态-环境协同进化的课程强化学习

人工智能 2023-09-25 v1

摘要

在漫长的历史中,自然物种学会了通过演化自身物理结构以适应环境变化而生存。相比之下,当前的强化学习(RL)研究主要聚焦于在固定环境中训练具有固定形态(如骨骼结构和关节属性)的智能体,其难以泛化到变化的环境或新任务。在本文中,我们通过“形态-环境协同进化(MECE)”来优化 RL 智能体及其形态,其中形态持续更新以适应变化的环境,而环境被逐步修改以带来新挑战并刺激形态的改进。这形成了一套训练可泛化 RL 的课程,其形态与策略针对不同环境进行优化。我们没有手工设计课程,而是训练两种策略来自动改变形态与环境。为此,(1)我们为这两种策略开发了两种新颖且有效的奖励,仅基于 RL 智能体的学习动态;(2)我们设计了一个调度器,以自动决定何时改变环境及形态。在两类任务的实验中,通过 MECE 训练的形态与 RL 策略在未见测试环境中展现出显著优于 SOTA 形态优化方法的泛化性能。我们对两种 MECE 策略的消融研究进一步表明,形态与环境之间的协同进化是成功的关键。

关键词

引用

@article{arxiv.2309.12529,
  title  = {Curriculum Reinforcement Learning via Morphology-Environment Co-Evolution},
  author = {Shuang Ao and Tianyi Zhou and Guodong Long and Xuan Song and Jing Jiang},
  journal= {arXiv preprint arXiv:2309.12529},
  year   = {2023}
}