中文

组合决策的结构化强化学习

机器学习 2025-10-29 v2 最优化与控制 机器学习

摘要

强化学习(RL)越来越多地应用于涉及复杂结构化决策的真实世界问题,如路由、调度和商品组合规划。这些场景对标准 RL 算法构成挑战,后者在组合动作空间存在时难以扩展、泛化和利用结构。我们提出结构化强化学习(SRL),一种将组合优化层嵌入行为者神经网络的新型行为者-评论家范式。我们通过 Fenchel-Young 损失实现行为者的端到端学习,并将 SRL 几何地解释为矩多面体对偶中的原始-对偶算法。在六个具有外生和内生不确定性的环境中,SRL 在静态任务上匹配或超越了非结构化 RL 和模仿学习的表现,在动态问题上将这些基线提升了高达 92%,同时具有更好的稳定性和收敛速度。

关键词

引用

@article{arxiv.2505.19053,
  title  = {Structured Reinforcement Learning for Combinatorial Decision-Making},
  author = {Heiko Hoppe and Léo Baty and Louis Bouvier and Axel Parmentier and Maximilian Schiffer},
  journal= {arXiv preprint arXiv:2505.19053},
  year   = {2025}
}

备注

29 pages, 8 figures, accepted at the 39th Annual Conference on Neural Information Processing Systems (NeurIPS 2025)