中文

ReviBranch:基于复活轨迹的深度强化学习分支定界法

机器学习 2025-08-26 v1

摘要

分支定界法(B&B)是混合整数线性规划(MILP)的主要求解器,其中分支变量的选择对计算效率至关重要。然而,传统的分支启发式方法往往难以在异构问题实例之间泛化,而现有的基于学习的方法,如模仿学习(IL)受限于专家演示质量,强化学习(RL)则在稀疏奖励和动态状态表示挑战方面受限。为此,我们提出 ReviBranch,一种新型深度强化学习框架,通过复活分支决策与其相应图状态之间的显式历史对应关系来构建复活轨迹。在训练期间,ReviBranch 使代理人能够从分支过程中的完整结构演化和时间依赖性中学习。此外,我们引入一种重要性加权奖励再分配机制,将稀疏终端奖励转化为稠密的逐步反馈,以解决稀疏奖励问题。在不同的 MILP 基准上进行的大量实验表明,ReviBranch 在节点数上减少 4.0%,在线性规划迭代数上减少 2.2%,显现出在异构 MILP 问题类别之间具有的鲁棒性和泛化性。

关键词

引用

@article{arxiv.2508.17452,
  title  = {ReviBranch: Deep Reinforcement Learning for Branch-and-Bound with Revived Trajectories},
  author = {Dou Jiabao and Nie Jiayi and Yihang Cheng and Jinwei Liu and Yingrui Ji and Canran Xiao and Feixiang Du and Jiaping Xiao},
  journal= {arXiv preprint arXiv:2508.17452},
  year   = {2025}
}

备注

conference