MisoDICE: 基于无标签混合质量演示的多智能体模仿学习
机器学习
2025-05-27 v1 人工智能
多智能体系统
摘要
我们研究了在合作多智能体环境中进行的离线模仿学习(IL),其演示具有无标签的混合质量—包含专家和次优轨迹。我们提出的解决方案包含两个阶段:轨迹标注和多智能体模仿学习,旨在联合启用有效地从异构无标签数据中学习。在第一个阶段,我们结合大语言模型和基于偏好的强化学习技术,构建了一个渐进式标注管道,用于区分专家质量的轨迹。在第二个阶段,我们引入MisoDICE,一种新的多智能体IL算法,利用这些标签来学习稳健的策略,同时解决大规模联合状态-动作空间的计算复杂度。通过将流行的单智能体DICE框架扩展到多智能体环境并采用新的价值分解和混合架构,我们的方法得到凸优化目标并确保全局与局部策略之间的一致性。在多个标准多智能体RL基准测试中评估了MisoDICE,结果表明该方法在专家数据稀缺时表现尤为出色。
引用
@article{arxiv.2505.18595,
title = {MisoDICE: Multi-Agent Imitation from Unlabeled Mixed-Quality Demonstrations},
author = {The Viet Bui and Tien Mai and Hong Thanh Nguyen},
journal= {arXiv preprint arXiv:2505.18595},
year = {2025}
}