中文

Decision Mamba: A Multi-Grained State Space Model with Self-Evolution Regularization for Offline RL

机器学习 2025-01-23 v3

摘要

虽然 transformer 架构的条件序列建模在处理离线强化学习任务方面表现出色,但在处理超出分布状态和动作方面存在挑战。现有工作通过数据增强或价值导向 RL 算法添加额外约束来尝试解决此问题,但仍未能克服以下挑战:(1) 不足够利用动作之间历史时间信息,(2) 忽略返回-状态-动作三元组之间的局部 intra-step 关系,(3) 过拟合带噪声标签的次优轨迹。为此,我们提出 Decision Mamba (DM),一种具有自演化正则化的多层次状态空间模型 (SSM)。DM 使用 mamba 架构显式建模历史隐藏状态以提取时间信息。为捕获 RTG-状态-动作三元组之间的关系,设计并集成细粒度 SSM 模块于原始粗粒度 SSM 中,形成专为离线 RL 设计的新型 mamba 架构。最后,通过渐进式正则化提出自演化策略,利用自身过去知识来细化次优动作,从而增强其对噪声演示文稿的鲁棒性。各种任务上的大量实验表明,DM 在其他基线上显著优于其他方法。

关键词

引用

@article{arxiv.2406.05427,
  title  = {Decision Mamba: A Multi-Grained State Space Model with Self-Evolution Regularization for Offline RL},
  author = {Qi Lv and Xiang Deng and Gongwei Chen and Michael Yu Wang and Liqiang Nie},
  journal= {arXiv preprint arXiv:2406.05427},
  year   = {2025}
}

备注

Accepted by NeurIPS 2024; Code is available at https://github.com/aopolin-lv/DecisionMamba