基于变分马尔可夫决策过程的分支定界中的变量选择
机器学习
2025-10-23 v1
摘要
混合整数线性规划(MILP)是解决广泛范围 NP 难组合优化问题的强大框架,常通过分支定界(B&B)求解。B&B 求解器性能的关键因素是控制分支决策的变量选择准则。近期研究尝试采用强化学习(RL)算法来适应 B&B 设置,以学习最优分支策略,通过受马尔可夫决策过程(MDP)启发的表格述形式,以及不成文的收敛定理和算法。在本工作中,我们引入了 BBMDP,这是一种原则化的 vanilla MDP 表述,用于 B&B 中的变量选择,允许利用广泛的 RL 算法来学习最优的 B&B 准则。计算实验验证了我们的模型的经验有效性,我们的分支智能体在四个标准 MILP 基准测试中超越了此前的最先进 RL 智能体。
引用
@article{arxiv.2510.19348,
title = {A Markov Decision Process for Variable Selection in Branch & Bound},
author = {Paul Strang and Zacharie Alès and Côme Bissuel and Olivier Juan and Safia Kedad-Sidhoum and Emmanuel Rachelson},
journal= {arXiv preprint arXiv:2510.19348},
year = {2025}
}