用于强化学习智能体迭代设计的价值函数分解
机器学习
2022-10-24 v2 人工智能
摘要
设计强化学习(RL)智能体通常是一个困难的过程,需要大量设计迭代。学习可能因众多原因而失败,而标准RL方法提供的工具太少,无法深入洞察确切原因。本文中,我们展示了如何将价值分解整合到广泛的actor-critic算法类中,并用其辅助迭代式智能体设计过程。价值分解将奖励函数分离为不同分量,并为每个分量学习价值估计。这些价值估计可洞察智能体的学习与决策过程,并支持新的训练方法来缓解常见问题。作为演示,我们引入了SAC-D,一种适配于价值分解的soft actor-critic(SAC)变体。SAC-D在保持与SAC相近性能的同时,学习了更大一组价值预测。我们还引入了利用此信息的基于分解的工具,包括一种新的奖励影响度量,用于衡量各奖励分量对智能体决策的影响。利用这些工具,我们提供了若干分解用于识别并解决环境与智能体设计问题的演示。价值分解具有广泛适用性且易于整合进现有算法与工作流,是RL实践者工具箱中的有力工具。
引用
@article{arxiv.2206.13901,
title = {Value Function Decomposition for Iterative Design of Reinforcement Learning Agents},
author = {James MacGlashan and Evan Archer and Alisa Devlic and Takuma Seno and Craig Sherstan and Peter R. Wurman and Peter Stone},
journal= {arXiv preprint arXiv:2206.13901},
year = {2022}
}
备注
10 content pages, 12 Appendix pages, 19 figures