基于图神经网络的 QUBO 形式哈密顿量启发损失函数用于强化学习组合优化
机器学习
2023-12-13 v1 人工智能
摘要
二次无约束二值优化(Quadratic Unconstrained Binary Optimization, QUBO)是一种以二值变量形式建模各类 NP-hard 组合优化(combinatorial optimization, CO)问题的通用技术。Ising 哈密顿量用于建模系统的能量函数。QUBO 到 Ising 哈密顿量被视为通过量子优化算法求解各类经典优化问题的技术。近来,PI-GNN 这一通用框架被提出,基于图神经网络(Graph Neural Network, GNN)架构处理图上的 CO 问题。其引入了通用的 QUBO 形式哈密顿量启发损失函数,并使用 GNN 直接优化。PI-GNN 具有高度可扩展性,但与特定问题算法相比,满足约束的数量明显下降,且随图密度增加而更显著。本文中,我们识别出与之相关的行为模式并设计策略以提升其性能。另一类文献使用强化学习(reinforcement learning, RL)借助特定问题奖励函数求解上述 NP-hard 问题。本工作中,我们也聚焦于在基于 RL 的求解方案与 QUBO 形式哈密顿量之间建立桥梁。我们公式化并实证评估了 QUBO 形式哈密顿量作为基于 RL 范式中通用奖励函数(以奖励形式)的兼容性。此外,我们引入一种新颖的基于蒙特卡洛树搜索(Monte Carlo Tree Search)结合 GNN 的策略,通过在训练中对节点标签进行手动扰动实现引导搜索。我们实证评估了所提方法,观察到与 PI-GNN 相比约束违反数量最多改善 44%。
引用
@article{arxiv.2311.16277,
title = {A Graph Neural Network-Based QUBO-Formulated Hamiltonian-Inspired Loss Function for Combinatorial Optimization using Reinforcement Learning},
author = {Redwan Ahmed Rizvee and Raheeb Hassan and Md. Mosaddek Khan},
journal= {arXiv preprint arXiv:2311.16277},
year = {2023}
}