策略梯度算法中动作表示影响的研究
机器学习
2023-09-14 v1
摘要
强化学习~(RL) 是一个用于学习解决复杂现实世界任务的多功能框架。然而,在实践中,影响 RL 算法学习性能的因素往往知之甚少。我们讨论了不同的分析技术,并评估了它们在研究 RL 中动作表示影响方面的有效性。我们的实验表明,在流行的 RL 基准任务上,动作表示会显著影响学习性能。分析结果表明,部分性能差异可归因于优化景观复杂度的变化。最后,我们讨论了 RL 算法分析技术面临的开放挑战。
引用
@article{arxiv.2309.06921,
title = {Investigating the Impact of Action Representations in Policy Gradient Algorithms},
author = {Jan Schneider and Pierre Schumacher and Daniel Häufle and Bernhard Schölkopf and Dieter Büchler},
journal= {arXiv preprint arXiv:2309.06921},
year = {2023}
}
备注
Published at the Workshop on effective Representations, Abstractions, and Priors for Robot Learning (RAP4Robots) at ICRA 2023