通过奖励切换策略优化持续发现新颖策略
机器学习
2022-05-04 v3 人工智能
摘要
我们提出奖励切换策略优化(RSPO),这是一种通过在复杂强化学习(RL)环境中迭代寻找既局部最优又与现有策略足够不同的新颖策略,从而发现多样化策略的范式。为鼓励学习策略持续收敛至先前未发现的局部最优,RSPO 在优化过程中通过基于轨迹的新颖性度量在外部奖励与内部奖励之间切换。当采样轨迹足够不同时,RSPO 使用外部奖励执行标准策略优化。对于在现有策略下具有高似然的轨迹,RSPO 利用内部多样性奖励来促进探索。实验表明,RSPO 能够在多种领域中 discovering 广泛的策略谱系,从单智能体粒子世界任务和 MuJoCo 连续控制,到多智能体 stag-hunt 博弈和 StarCraftII 挑战。
引用
@article{arxiv.2204.02246,
title = {Continuously Discovering Novel Strategies via Reward-Switching Policy Optimization},
author = {Zihan Zhou and Wei Fu and Bingliang Zhang and Yi Wu},
journal= {arXiv preprint arXiv:2204.02246},
year = {2022}
}
备注
30 pages, 15 figures, published as a conference paper at ICLR 2022