解决基于优势强化学习算法的标量化问题
机器学习
2021-10-04 v4 机器学习
摘要
本研究探讨了优势 actor-critic(A2C)强化学习算法中多目标优化问题标量化所引发的一些问题。论文展示了朴素标量化如何导致梯度重叠。此外,讨论了熵正则化项可能成为不受控噪声来源的可能性。针对上述 issues,提出了一种在保持相同损失公式的同时避免梯度重叠的技术。而且,研究了一种通过从具有期望最小熵的分布中采样动作来避免不受控噪声的方法。已开展初步实验以展示所提方法如何加速训练。所提方法可应用于任何基于优势的强化学习算法。
引用
@article{arxiv.2004.04120,
title = {Solving the scalarization issues of Advantage-based Reinforcement Learning Algorithms},
author = {Federico A. Galatolo and Mario G. C. A. Cimino and Gigliola Vaglini},
journal= {arXiv preprint arXiv:2004.04120},
year = {2021}
}