基于强化学习微调的小型专用 LLM 用于 CVRP 混合遗传搜索的精细化
机器学习
2025-10-14 v1
摘要
尽管大型语言模型 (LLM) 正在日益被用作车辆路径问题 (VRP) 的自动化启发式设计器,但当前的最先进方法主要依赖对 GPT-4 等大型通用模型的提示。本工作通过演示小型专用 LLM 在精心微调后,能够生成超过高级求解器中专家设计启发式方法的组件,来挑战这一范式。我们提出了 RFTHGS,即一种用于微调小型 LLM 以为混合遗传搜索 (HGS) 求解器生成高性能交叉算子的强化学习 (RL) 框架,适用于载运能力限制 VRP (CVRP)。该方法采用多层次、基于课程的奖励函数,逐步引导 LLM 掌握生成可编译、可执行以及最终超越人类专家设计的算子。同时,引入算子缓存机制以防止抄袭并促进训练中的多样性。全面实验表明,我们的微调 LLM 生成的交叉算子在 HGS 中显著优于专家设计的算子。性能优势从小规模实例延伸至最多 1000 个节点的大规模问题,保持一致。此外,RFTHGS 在领先的神经组合基准、基于提示的方法以及商业 LLM 如 GPT-4o 和 GPT-4o-mini 方面均取得优异成绩。
引用
@article{arxiv.2510.11121,
title = {Refining Hybrid Genetic Search for CVRP via Reinforcement Learning-Finetuned LLM},
author = {Rongjie Zhu and Cong Zhang and Zhiguang Cao},
journal= {arXiv preprint arXiv:2510.11121},
year = {2025}
}