中文

基于大语言模型的自动化强化学习奖励设计框架用于合作编队协调

机器学习 2025-04-29 v1 人工智能

摘要

强化学习 (RL) 已在编队协调问题中显示出卓越的决策潜力。然而,由于协调目标的多样性、决策问题的复杂性以及手动设计中试错耗时的,寻找用于解决复杂编队协调问题的高绩效奖励函数以指导 RL 训练仍具有挑战性。本文正式定义了编队协调奖励设计问题 (PCRDP),将基于 RL 的协作编队协调问题扩展到包含自动化奖励函数生成。为解决 PCRDP,我们提出一种基于大语言模型 (LLM) 的编队协调奖励设计 (PCRD) 框架,通过 LLM 驱动的初始化和迭代优化系统地自动化奖励函数发现。在该方法中,LLM 首先通过分析和初始奖励 (AIR) 模块基于环境代码和任务要求初始化奖励函数,然后通过进化模块基于训练反馈迭代优化。AIR 模块通过链式思考引导 LLM 深化对代码和任务的理解,从而有效缓解代码生成中的幻觉风险。进化模块对奖励函数进行微调和重构,实现训练中探索多样性与收敛稳定性之间的平衡。为验证我们的方法,我们在长江大盆地交通网络仿真中建立了六个具有不同复杂度水平的具有挑战性的协调场景。比较实验结果表明,使用 PCRD 生成的奖励函数训练的 RL 代理在所有场景中 consistently 优于人工设计的奖励函数,平均提升 10% 的绩效指标。

关键词

引用

@article{arxiv.2504.19480,
  title  = {An Automated Reinforcement Learning Reward Design Framework with Large Language Model for Cooperative Platoon Coordination},
  author = {Dixiao Wei and Peng Yi and Jinlong Lei and Yiguang Hong and Yuchuan Du},
  journal= {arXiv preprint arXiv:2504.19480},
  year   = {2025}
}