面向强化学习训练动作空间的数据驱动评估
机器学习
2022-04-11 v1
摘要
由于状态-动作关系复杂,强化学习(RL)中训练动作空间的选择容易产生冲突。为应对这一挑战,本文提出一种受 Shapley 值启发的方法,用于训练动作空间的分类与排序。为降低指数级时间的 Shapley 计算开销,该方法包含蒙特卡洛模拟以避免不必要的探索。通过一个云基础设施资源调优案例研究说明了该方法的有效性:它将搜索空间减少了 80%,并将训练动作集合分类为可有可无与不可或缺两组。此外,它对不同训练动作进行排序,以促进高性能且高成本效益的 RL 模型设计。所提出的数据驱动方法可扩展至不同领域、用例和强化学习算法。
引用
@article{arxiv.2204.03840,
title = {Data-Driven Evaluation of Training Action Space for Reinforcement Learning},
author = {Rajat Ghosh and Debojyoti Dutta},
journal= {arXiv preprint arXiv:2204.03840},
year = {2022}
}
备注
11 pages