超越浅层行为:基于技能发现的任务高效价值型多任务离线 MARL
机器学习
2025-09-29 v2 人工智能
多智能体系统
摘要
作为一种数据驱动的方法,离线 MARL 仅从离线数据集中学习优越策略,适用于历史数据丰富但交互成本高昂和风险较大的领域。然而,大多数现有方法是任务特定的,需要为新任务重新训练,导致冗余和低效。为此,我们提出一种任务高效价值型多任务离线 MARL 算法——技能发现保守 Q 学习 (SD-CQL)。不同于现有方法通过行为克隆解码动作的做法,SD-CQL 通过重构下一个观察在潜在空间中发现技能,分别评估固定和可变动作,并使用保守 Q 学习结合局部价值校准为每个技能选择最优动作。它消除了局部-全局对齐的需求,使其能够从有限且小规模源任务中实现强大的多任务泛化。大量在 StarCraft II 上的实验表明,SD-CQL 在泛化性能和任务效率方面表现出色。在 14 个任务集合中,SD-CQL 在 13 个任务集合上取得最佳性能,单任务集合提升最高可达 68.9%。
引用
@article{arxiv.2502.08985,
title = {Beyond Shallow Behavior: Task-Efficient Value-Based Multi-Task Offline MARL via Skill Discovery},
author = {Xun Wang and Zhuoran Li and Hai Zhong and Longbo Huang},
journal= {arXiv preprint arXiv:2502.08985},
year = {2025}
}