通过增加熵提升策略梯度在个性化任务上的性能
机器学习
2023-10-10 v1
摘要
在本工作中,我们考察正则化对使用策略梯度训练的强化学习智能体所生成策略所采取动作多样性的影响。策略梯度智能体易出现熵崩溃,即某些动作极少甚至从未被选择。我们用由各种 -散度和最大均值差异构造的项来增强策略的优化目标函数,以鼓励当前策略遵循与先前计算的策略不同的状态访问和/或动作选择分布。我们使用MNIST、CIFAR10和Spotify数据集提供了数值实验。结果展示了促进多样性的策略正则化的优势,且其在基于梯度的方法上的使用显著提升了多种个性化任务的性能。此外,给出了数值证据以表明策略正则化在不损失准确率的情况下提升了性能。
引用
@article{arxiv.2310.05324,
title = {Increasing Entropy to Boost Policy Gradient Performance on Personalization Tasks},
author = {Andrew Starnes and Anton Dereventsov and Clayton Webster},
journal= {arXiv preprint arXiv:2310.05324},
year = {2023}
}
备注
8 pages, 3 figures, accepted to WAIN 2023