面向强化学习的无奖励策略空间压缩
机器学习
2022-02-23 v1
摘要
在强化学习中,我们将智能体与环境交互的潜在行为编码为无限策略集(即策略空间),通常由参数化函数族表示。处理此类策略空间是一项艰巨挑战,常导致采样与计算低效。然而我们认为,当同时考虑环境结构与策略参数化时,实际相关的策略数量有限,因为许多策略会诱导出极为相似的交互,即状态-动作分布。本文寻求将策略空间无奖励地压缩为有限代表性策略集,使得对任意策略 ,代表性策略的状态-动作分布与 的状态-动作分布之间的最小 Rényi 散度有界。我们表明该策略空间压缩可表述为集合覆盖问题,且本质上是 NP-hard 的。尽管如此,我们提出了一种博弈论重构,其局部最优解可通过迭代拉伸压缩空间以覆盖对抗策略而高效求得。最后,我们提供实证评估以阐明简单域中的压缩过程及其在强化学习中的连锁效应。
引用
@article{arxiv.2202.11079,
title = {Reward-Free Policy Space Compression for Reinforcement Learning},
author = {Mirco Mutti and Stefano Del Col and Marcello Restelli},
journal= {arXiv preprint arXiv:2202.11079},
year = {2022}
}
备注
In 25th International Conference on Artificial Intelligence and Statistics