潜在球面流政策:用于组合动作强化学习
机器学习
2026-02-02 v1
摘要
组合动作空间的强化学习(RL)仍然具有挑战性,因为可行动集合呈指数级增长,并受到复杂可行性约束的制约,直接的政策参数化方法难以实现。现有方法将任务特定价值函数嵌入受约束优化程序中,或学习确定性结构政策,牺牲了通用性和政策表达性。我们提出一种solver诱导的"潜在球面流政策",将现代生成式政策的表达性引入组合RL中,同时通过设计保证可行性。我们的方法LSFlow通过球面流匹配学习一个"随机"政策,其在紧凑的连续潜在空间中,然后将可行性委托给一个组合优化solver,该solver将每个潜在样本映射到有效的结构动作。为提高效率,我们直接在潜在空间中训练价值网络,避免了在政策优化期间重复调用solver。为了解决由solver基于动作选择导致的分段常数和不连续价值景观问题,我们引入平滑Bellman算子,以获得稳定、明确定义的学习目标。实验结果表明,我们的方法在一系列具有挑战性的组合RL任务中平均超过最先进的基线方法约20.6%。
引用
@article{arxiv.2601.22211,
title = {Latent Spherical Flow Policy for Reinforcement Learning with Combinatorial Actions},
author = {Lingkai Kong and Anagha Satish and Hezi Jiang and Akseli Kangaslahti and Andrew Ma and Wenbo Chen and Mingxiao Song and Lily Xu and Milind Tambe},
journal= {arXiv preprint arXiv:2601.22211},
year = {2026}
}