中文

SORREL:用于学习分支的次优演示引导强化学习

机器学习 2025-02-27 v2

摘要

混合整数线性规划 (MILP) 求解器主要建立在分支定界 (B&B) 算法之上,其中传统求解器的效率严重依赖于手工设计的分支启发式策略。过去几年中,数据驱动方法在自动学习这些启发式策略方面越来越受欢迎。然而,这些方法的成功高度依赖于高质量演示的可用性,而这需要开发近乎最优的启发式策略或耗时的采样过程。本文通过提出用于学习分支的次优演示引导强化学习 (SORREL) 来规避这一挑战。SORREL 基于价值估计选择性地从次优演示中学习。它通过在次优启发式策略生成的演示上进行离线强化学习,以及在自身采样的过往良好经验上进行自我模仿学习,来利用次优演示。我们的实验表明,在各种 MILP 上,与先前的方法相比,该方法在分支质量和训练效率方面均展现出优越的性能。

关键词

引用

@article{arxiv.2412.15534,
  title  = {SORREL: Suboptimal-Demonstration-Guided Reinforcement Learning for Learning to Branch},
  author = {Shengyu Feng and Yiming Yang},
  journal= {arXiv preprint arXiv:2412.15534},
  year   = {2025}
}

备注

AAAI 2025