AutoDIME:有趣的多智能体环境的自动设计
机器学习
2022-03-07 v1 人工智能
多智能体系统
机器学习
摘要
设计一种强化学习(RL)智能体能够从中学习有趣且有用的技能的环境分布是一项具有挑战性且理解甚少的工作,而对于多智能体环境,其困难只会加剧。一种方法是训练第二个 RL 智能体,称为教师(teacher),由其采样出有利于学生智能体学习的环境。然而,先前提出的大多数教师奖励并不能直接推广到多智能体设定中。我们研究了一组源于预测问题、可应用于多智能体设定的内在教师奖励,并在 Mujoco 任务(如多智能体捉迷藏)以及一项诊断性单智能体迷宫任务中对其进行了评估。在所考虑的内在奖励中,我们发现价值分歧(value disagreement)在各任务间最为稳定,能在捉迷藏和迷宫任务中更快且更可靠地催生高级技能。另一候选内在奖励——价值预测误差(value prediction error),在捉迷藏中也表现良好,但在随机环境中易受 noisy-TV 式干扰。策略分歧(policy disagreement)在迷宫任务中表现良好,但未能加速捉迷藏中的学习。我们的结果表明,内在教师奖励,尤其是价值分歧,是一种颇具前景的自动化单智能体与多智能体环境设计方法。
引用
@article{arxiv.2203.02481,
title = {AutoDIME: Automatic Design of Interesting Multi-Agent Environments},
author = {Ingmar Kanitscheider and Harri Edwards},
journal= {arXiv preprint arXiv:2203.02481},
year = {2022}
}
备注
first submission