变换后探索:一种用于强化学习探索式组合优化的简单有效技术
机器学习
2024-04-09 v1 人工智能
摘要
在生产和日常生活中遇到的许多复杂问题都可以被概念化为图上的组合优化问题(COPs)。近年来,基于强化学习(RL)的模型已成为一个有前景的方向,它将 COPs 的求解视为一个启发式学习问题。然而,当前基于有限时程 MDP 的 RL 模型具有内在局限性。它们不允许在测试时进行充分的探索以改进解决方案,而考虑到 NP-hard 优化任务的复杂性,这可能是必要的。最近的一些尝试通过专注于奖励设计和状态特征工程来解决这一问题,但这些方法既繁琐又具有临时性。在这项工作中,我们提出了一种更简单但更有效的技术,称为规范变换(gauge transformation, GT)。该技术源于物理学,但在使 RL 智能体能够在测试期间通过探索持续改进解决方案方面非常有效。此外,GT 非常简单,可以用不到 10 行 Python 代码实现,并且可以应用于绝大多数 RL 模型。在实验中,我们展示了带有 GT 技术的传统 RL 模型在 MaxCut 问题上取得了最先进的性能。此外,由于 GT 独立于任何 RL 模型,它可以无缝集成到各种 RL 框架中,为这些模型在求解一般 COPs 时进行更有效的探索铺平了道路。
引用
@article{arxiv.2404.04661,
title = {Transform then Explore: a Simple and Effective Technique for Exploratory Combinatorial Optimization with Reinforcement Learning},
author = {Tianle Pu and Changjun Fan and Mutian Shen and Yizhou Lu and Li Zeng and Zohar Nussinov and Chao Chen and Zhong Liu},
journal= {arXiv preprint arXiv:2404.04661},
year = {2024}
}