三思而后行:面向大规模决策的 LLM 与 RL 协同演化框架
人工智能
2025-06-04 v1
摘要
大型语言模型(LLM)和强化学习(RL)的最新进展在决策任务中展现出了巨大潜力。然而,对于大规模工业决策问题,这两种方法面临着不同的挑战:LLM 缺乏实时长序列决策能力,而 RL 在庞大的动作空间中难以保证样本效率。为了弥合这一差距,我们提出了 Agents Co-Evolution(ACE),一个用于大规模决策场景的 LLM 与 RL 智能体协同框架。ACE 引入了一种双重角色轨迹优化机制,其中 LLM 在 RL 训练过程中同时充当策略执行者和价值评论者:执行者通过多步推理和环境验证来优化次优动作,而评论者则通过轨迹级奖励塑形进行时序信用分配。同时,RL 智能体利用通过优先经验回放生成的高质量微调数据集,增强了 LLM 针对特定任务的决策能力。通过在动作空间超过 60K 个离散动作的多个电网运行挑战中进行广泛实验,ACE 展现出优于现有 RL 方法和基于 LLM 方法的卓越性能。
引用
@article{arxiv.2506.02522,
title = {Think Twice, Act Once: A Co-Evolution Framework of LLM and RL for Large-Scale Decision Making},
author = {Xu Wan and Wenyue Xu and Chao Yang and Mingyang Sun},
journal= {arXiv preprint arXiv:2506.02522},
year = {2025}
}