基于低频截断的自适应上下文长度优化用于多主体强化学习
机器学习
2026-03-03 v2 多智能体系统
摘要
最近的深度多主体强化学习(multi-agent reinforcement learning, MARL)在解决长期依赖和非马尔可夫环境等具有挑战性的任务方面显示出巨大的潜力。其成功部分归因于对大型固定上下文长度进行条件化。然而,这种大型固定上下文长度可能导致探索效率受限和冗余信息。本文提出了一种新型 MARL 框架,以获得自适应且有效的上下文信息。具体而言,我们设计了一个中心智能体,通过时序梯度分析动态优化上下文长度,从而增强探索以促进 MARL 中收敛到全局最优。此外,为了增强自适应优化上下文长度的能力,我们提出了一种高效的输入表示方法,用于中心智能体,这有效地过滤了冗余信息。通过利用基于傅里叶的低频截断方法,我们提取了来自去中心化智能体之间的全局时序趋势,为 MARL 环境提供了有效且高效的表示。广泛的实验表明,所提方法在 PettingZoo、MiniGrid、Google Research Football(GRF)和 StarCraft Multi-Agent Challenge v2(SMACv2)等长期依赖任务上实现了最先进(SOTA)性能。
引用
@article{arxiv.2510.26389,
title = {Adaptive Context Length Optimization with Low-Frequency Truncation for Multi-Agent Reinforcement Learning},
author = {Wenchang Duan and Yaoliang Yu and Jiwan He and Yi Shi},
journal= {arXiv preprint arXiv:2510.26389},
year = {2026}
}