中文

投影潜在强化学习动作:迈向可泛化且可扩展的图组合优化

人工智能 2026-05-20 v1 机器学习 网络与互联网体系结构

摘要

图组合优化(GCO)已引起越来越多的关注,因为许多 NP 难问题天然地允许图表示,但其组合爆炸特性使得精确方法在计算上难以处理。强化学习(RL)与图神经网络(GNN)结合的最新进展显著改进了基于学习的 GCO 求解器。然而,现有方法在跨不同图实例的泛化能力以及随动作空间增长的计算可扩展性方面均面临局限。为应对这两个挑战,我们引入了投影智能体,这是一种新颖的 RL-GCO 方法,它直接在基于 GNN 的连续动作嵌入空间中运行,通过单次前向传播预测所需的潜在动作,并随后将其解码为有效的离散动作。此外,我们通过为观察和动作提供共享的嵌入空间,实现了跨 RL 方法的公平比较。在多个基准测试中,我们的方法仅使用简单的最近邻解码,就实现了比现有解决方案快达 16.2 倍的推理速度和高达 40% 的泛化能力提升,同时为在具有多个相互依赖变量的超线性决策空间中实现强大的 RL 性能打开了大门。最后,我们发布了 LaGCO-RL,这是一个 Python 库,可自动构建潜在动作空间并支持现有的 RL-GCO 解决方案,从而促进可复现性并适应新的 GCO 基准。

关键词

引用

@article{arxiv.2605.19721,
  title  = {Projecting Latent RL Actions: Towards Generalizable and Scalable Graph Combinatorial Optimization},
  author = {Franco Terranova and Guillermo Bernardez and Albert Cabellos-Aparicio and Nina Miolane and Abdelkader Lahmadi},
  journal= {arXiv preprint arXiv:2605.19721},
  year   = {2026}
}

备注

Preprint