Mamba 是否与离线强化学习中的轨迹优化方法兼容?
机器学习
2024-10-29 v2
摘要
Transformer-based 轨迹优化方法在离线强化学习中展现出卓越的性能。然而,其参数规模大、可扩展性有限,使得其在计算资源受限的序列决策场景(如机器人和无人机)面临挑战。Mamba 是一种新型线性时间序列模型,虽在长序列上性能与 Transformer 相当,但参数显著更少。鉴于 Mamba 是否与轨迹优化兼容尚不明确,本文通过实验探讨了基于数据结构和关键组件的 Decision Mamba(DeMa)在离线 RL 中的潜力,主要发现:(1) 长序列虽增加计算负担,却未显著提升性能,因为 DeMa 对序列的关注约呈指数衰减。因此,我们提出类似 Transformer 的 DeMa 而非类 RNN 的 DeMa。(2) 在 DeMa 的组件中,隐藏注意力机制是其成功的关键因素,亦可与其他残差结构良好集成,且无需位置编码。广泛评估表明,我们设计的 DeMa 能与轨迹优化良好兼容,超越了 Decision Transformer (DT),在 Atari 上实现更高性能且参数减少 30%,在 MuJoCo 上仅用原参数的四分之一。
引用
@article{arxiv.2405.12094,
title = {Is Mamba Compatible with Trajectory Optimization in Offline Reinforcement Learning?},
author = {Yang Dai and Oubo Ma and Longfei Zhang and Xingxing Liang and Shengchao Hu and Mengzhu Wang and Shouling Ji and Jincai Huang and Li Shen},
journal= {arXiv preprint arXiv:2405.12094},
year = {2024}
}
备注
23 pages, 11 figures