cMALC-D:基于多智能体LLM引导的语义化多智能体强化学习课程学习
机器学习
2025-08-29 v1 多智能体系统
摘要
许多多智能体强化学习(MARL)算法在固定仿真环境中训练,导致在更复杂和不确定的真实场景中部署时脆弱。情境化MARL(cMARL)通过对环境进行情境变量参数化,并训练情境无关策略以在所有环境配置下表现良好来解决此问题。现有cMARL方法尝试利用课程学习来帮助训练和评估情境无关策略,但常依赖不可靠的代理信号,如价值估计或广义优势估计,这些在多智能体环境中因智能体间动态和部分可观测性而噪声且不稳定。为解决这些问题,我们提出Contextual Multi-Agent LLM-Guided Curriculum Learning with Diversity-Based Context Blending(cMALC-D),一种框架利用大语言模型(LLM)生成语义有意义的课程并提供更稳健的评估信号。为防止模式坍塌并鼓励探索,我们引入基于多样性的情境混合机制,通过组合先前情境的特征创建新的训练场景。traffic signal control 领域的实验表明,cMALC-D显著优于现有课程学习基线方法,提高了泛化能力和样本效率。我们在https://github.com/DaRL-LibSignal/cMALC-D 提供代码。
引用
@article{arxiv.2508.20818,
title = {cMALC-D: Contextual Multi-Agent LLM-Guided Curriculum Learning with Diversity-Based Context Blending},
author = {Anirudh Satheesh and Keenan Powell and Hua Wei},
journal= {arXiv preprint arXiv:2508.20818},
year = {2025}
}
备注
A shorter version has been accepted to the 2025 Conference on Information and Knowledge Management