通过排除实现多样性(DTE):基于价值分解的强化学习生态位辨识
人工智能
2023-02-06 v2 神经与进化计算
摘要
许多环境包含大量可用且价值各异的生态位,每个生态位关联于行为空间(策略空间)中不同的局部最优。在此类情形下,往往难以设计一种学习过程,足以避开劣质局部最优的干扰而偶然发现最佳可用生态位。本工作中我们提出一种通用强化学习(RL)算法,在此类具有多价值各异生态位的环境中表现优于基线深度 Q 学习算法。我们提出的算法由两部分组成:智能体架构与学习规则。智能体架构包含多个子策略。学习规则受演化计算中的适应度共享启发,并以一种新颖方式将价值分解网络应用于单智能体内部种群的强化学习中。具体可理解为增加一项额外损失项,其中一个策略的经验也用于以减小其他策略对所访问状态价值估计的方式更新所有其他策略。特别地,当某个子策略频繁访问特定状态时,会降低其他子策略对该状态所预测的价值。此外,我们引入一个受人工化学启发的平台,易于创建利用不同资源(即多生态位)的具多奖励策略任务。我们表明,以此方式训练的智能体能够逃离劣质但具吸引力的局部最优,转而收敛于在人工化学环境及更简单的示例性环境中更难发现的更高价值策略。
引用
@article{arxiv.2302.01180,
title = {Diversity Through Exclusion (DTE): Niche Identification for Reinforcement Learning through Value-Decomposition},
author = {Peter Sunehag and Alexander Sasha Vezhnevets and Edgar Duéñez-Guzmán and Igor Mordach and Joel Z. Leibo},
journal= {arXiv preprint arXiv:2302.01180},
year = {2023}
}
备注
Full length paper accompanying short format appearing at AAMAS 2023