中文

CADO:从模仿到成本最小化——面向组合优化的热力图求解器

机器学习 2026-02-10 v1 机器学习

摘要

基于热力图的求解器已成为组合优化(CO)中一种有前景的范式。然而,我们认为主流的监督学习(SL)训练范式存在根本性的目标不匹配:最小化模仿损失(例如,交叉熵)并不能保证解的成本最小化。我们将这种不匹配分解为两个缺陷:解码器盲区(忽略不可微的解码过程)和成本盲区(优先考虑结构模仿而非解的质量)。我们通过实验证明,这些固有缺陷施加了一个硬性性能上限。为克服这一限制,我们提出了CADO(面向优化的成本感知扩散模型),这是一个精简的强化学习微调框架,它将扩散去噪过程表述为一个马尔可夫决策过程(MDP),以直接优化解码后的解成本。我们引入了标签中心奖励,将真实标签重新用作无偏基线而非模仿目标,并引入了混合微调以实现参数高效的适应。CADO在多种基准测试中取得了最先进的性能,验证了目标对齐对于释放热力图求解器全部潜力的必要性。

关键词

引用

@article{arxiv.2602.08210,
  title  = {CADO: From Imitation to Cost Minimization for Heatmap-based Solvers in Combinatorial Optimization},
  author = {Hyungseok Song and Deunsol Yoon and Kanghoon Lee and Han-Seul Jeong and Soonyoung Lee and Woohyung Lim},
  journal= {arXiv preprint arXiv:2602.08210},
  year   = {2026}
}