中文

CORL:基于分支定界求解的混合整数线性规划策略的强化学习

人工智能 2025-12-15 v1 机器学习 系统与控制 系统与控制 最优化与控制

摘要

组合序列决策问题通常建模为混合整数线性规划(MILP),并通过分支定界(B&B)算法求解。准确建模 MILP 以代表现实问题的难度,导致实际中性能不佳。最近,机器学习方法被应用于构建以决策质量为导向的 MILP 模型,而非如何准确建模现实问题。然而,这些方法通常依赖监督学习,假设获取真实最优决策,并使用 MILP 梯度的替代方案。本文引入了一个概念证明性的CORL框架,通过在真实数据上对 MILP 方案进行端到端微调,以强化学习(RL)方式实现操作性能最大化。我们通过将由 B&B 求解的 MILP 作为兼容 RL 的可微随机策略来实现此目标。我们在一个简单 illustrative 的组合序列决策示例中验证了CORL方法。

关键词

引用

@article{arxiv.2512.11169,
  title  = {CORL: Reinforcement Learning of MILP Policies Solved via Branch and Bound},
  author = {Akhil S Anand and Elias Aarekol and Martin Mziray Dalseg and Magnus Stalhane and Sebastien Gros},
  journal= {arXiv preprint arXiv:2512.11169},
  year   = {2025}
}