SMAC-R1:决策任务中智能的出现
人工智能
2025-03-07 v3
摘要
星际多智能体挑战(StarCraft Multi-Agent Challenge, SMAC)是多智能体强化学习(MARL)中最常用的实验环境之一,其具体任务是控制一定数量的盟军单位来击败敌军。传统的MARL算法通常需要数百万步与环境交互来训练参数化模型,生成的策略通常是不可解释的且迁�移性弱。在本文中,我们引入了SMAC-R1,其基于DeepSeek-Coder-v2.5-236B蒸馏的Qwen2.5-7B-Base LLM。类似于在离线学习过程中进行行为克隆后的在线强化学习,我们的管道中,智能体通过提供任务描述来生成决策树代码,并通过环境提供的奖励反馈进行自我反思。在此基础上,我们增强生成的脚本,通过监督微调(SFT)来蒸馏决策能力,同时通过群体相对政策优化(GRPO)算法来增强脚本生成能力。我们在原始23个SMAC任务和10个新设计的任务中进行实验,表明该方法能够产生高质量、可解释的决策树,仅需少量环境探索。此外,这些脚本具有很强的迁移性,成功应用于无需修改的均匀SMAC环境。我们认为,这种方法为解决决策任务和特定领域的LLM训练管道提供了新的方向。
引用
@article{arxiv.2410.16024,
title = {SMAC-R1: The Emergence of Intelligence in Decision-Making Tasks},
author = {Yue Deng and Weiyu Ma and Yuxin Fan and Ruyi Song and Yin Zhang and Haifeng Zhang and Jian Zhao},
journal= {arXiv preprint arXiv:2410.16024},
year = {2025}
}