中文

强化学习中带任意约束的随机动作生成建模

机器学习 2023-11-28 v1

摘要

强化学习(RL)中的许多问题寻求在大型离散、多维且无序的动作空间中找到最优策略;这些问题包括资源随机分配问题,例如多个安全资源与应急响应单元的布置等。此场景中的一个挑战在于底层动作空间是类别型的(离散且无序)且规模庞大,现有 RL 方法在此类问题上表现不佳。此外,这些问题要求实现的动作(分配)有效;该有效性约束通常难以用紧凑的闭式数学形式表达。问题的分配性质也偏好随机最优策略(若存在)。在本工作中,我们通过以下方式应对这些挑战:(1)应用(状态)条件归一化流来紧凑表示随机策略——紧凑性源于网络仅生成一个采样动作及该动作的相应对数概率,随后被 actor-critic 方法使用;(2)采用无效动作拒绝方法(经由有效动作预言机)来更新基础策略。动作拒绝由我们推导的改进策略梯度所实现。最后,我们进行大量实验,以展示相较于先前方法我们的方法的可扩展性,以及在任何状态下对动作分布支撑集施加任意状态条件约束的能力。

关键词

引用

@article{arxiv.2311.15341,
  title  = {Generative Modelling of Stochastic Actions with Arbitrary Constraints in Reinforcement Learning},
  author = {Changyu Chen and Ramesha Karunasena and Thanh Hong Nguyen and Arunesh Sinha and Pradeep Varakantham},
  journal= {arXiv preprint arXiv:2311.15341},
  year   = {2023}
}

备注

Accepted in NeurIPS 2023. Website: https://cameron-chen.github.io/flow-iar/