TreeDQN:面向组合优化的样本高效离策略强化学习
机器学习
2026-05-22 v2 最优化与控制
摘要
最优求解组合优化任务的一种便捷方法是分支定界法。其分支启发式可被学习以求解大量相似任务。近期出现的基于树马尔可夫决策过程(tree MDP)的 on-policy 强化学习方法在此取得了可喜结果。为克服其主要缺点,即极长训练时间与不稳定训练,我们提出 TreeDQN(Tree Deep Q-Network),一种通过优化期望回报几何平均训练的 sample-efficient off-policy RL 方法。为从理论上支撑本方法的训练过程,我们证明了树 MDP 下贝尔曼算子的压缩性质。结果表明,在合成任务上,本方法所需训练数据至多减少 10 倍,且比已知 on-policy 方法更快。此外,在来自 ML4CO 竞赛的一项困难实际任务上,TreeDQN 显著优于最先进技术。
引用
@article{arxiv.2306.05905,
title = {TreeDQN: Sample-Efficient Off-Policy Reinforcement Learning for Combinatorial Optimization},
author = {D. Sorokin and A. Kostin and L. Savchenko and G. Gusev and A. V. Savchenko},
journal= {arXiv preprint arXiv:2306.05905},
year = {2026}
}
备注
Accepted in Knowledge-Based Systems