双向蒸馏:多智能体通用行为的混合玩法框架
机器学习
2025-05-19 v1 人工智能
摘要
population-population generalization 是多智能体强化学习(MARL)中具有挑战性的问题,尤其是在智能体遇到未知协作者时。然而,现有的 self-play 方法受限于 inside-space generalization 的限制。本研究提出了Bidirectional Distillation(BiDist),一种新型混合玩法框架,以克服MARL中的这一限制。BiDist 在两个交替方向上利用知识蒸馏:前向蒸馏模拟历史策略空间,创建隐式的 self-play;逆向蒸馏则系统性地将智能体驱向自知 policy 空间之外的新分布,以非 self-play 的方式实现。此外,BiDist 作为一种简洁高效的解决方案,无需存储过去复杂且昂贵的策略。我们提供了理论分析和实证证据支持BiDist的有效性。我们的结果突显了其在各种合作、竞争和社会困境任务中的卓越泛化能力,并揭示了BiDist显著多样化策略分布空间的作用。我们还present了全面的消融研究,以强化BiDist的有效性和关键成功因素。源代码已包含在补充材料中。
引用
@article{arxiv.2505.11100,
title = {Bidirectional Distillation: A Mixed-Play Framework for Multi-Agent Generalizable Behaviors},
author = {Lang Feng and Jiahao Lin and Dong Xing and Li Zhang and De Ma and Gang Pan},
journal= {arXiv preprint arXiv:2505.11100},
year = {2025}
}