STAIRS-Former:面向离线多任务多智能体强化学习的时空注意力交错递归结构Transformer
人工智能
2026-03-13 v1
摘要
带有多任务数据集的离线多智能体强化学习(MARL)具有代理人数跨任务变化以及需推广至未见情境的挑战。以往方法采用观察分词和层次技能学习来应对这些问题,但未充分利用Transformer注意力机制实现代理间协调,且仅依赖单个历史记号,限制了其在部分可观测MARL情境下捕捉长期时序依赖的能力。本文提出STAIRS-Former,一种增强了时空层次结构的Transformer架构,使其能够对关键记号进行有效注意力,同时捕捉长交互历史。我们进一步引入token dropout以提升在代理人数变化的情境下的鲁棒性与泛化能力。我们在多样化的多智能体基准(包括SMAC、SMAC-v2、MPE和MaMuJoCo)上进行了大量实验,验证了基于多任务数据集的有效性。实验结果表明,STAIRS-Former在各类基准上均一致超越先前方法,取得了新的最佳性能。
关键词
引用
@article{arxiv.2603.11691,
title = {STAIRS-Former: Spatio-Temporal Attention with Interleaved Recursive Structure Transformer for Offline Multi-task Multi-agent Reinforcement Learning},
author = {Jiwon Jeon and Myungsik Cho and Youngchul Sung},
journal= {arXiv preprint arXiv:2603.11691},
year = {2026}
}