决策变换器 vs. 决策马布拉:分析 Atari 游戏中序列决策建模的复杂度
机器学习
2024-12-03 v1 人工智能
摘要
本工作分析了在 Atari 游戏中进行序列建模强化学习任务中,决策变换器(Decision Transformer)和决策马布拉(Decision Mamba)之间性能差异。首先观察到,DM在Breakout和Qbert等游戏中通常优于DT,而DT在更复杂的游戏(如Hero和Kung Fu Master)中表现更好。为理解这些差异,我们将游戏数量扩展到12个,并对游戏特征进行了全面分析,包括动作空间复杂度、视觉复杂度、平均轨迹长度以及到达第一个非零奖励的平均步骤。在进一步分析DT和DM之间性能差异影响关键因素时,我们采用了包括量化视觉复杂度、随机森林回归、相关性分析和动作空间简化策略等多种方法。结果表明,DT和DM之间性能差异受到多个因素复杂相互作用的影响,其中动作空间复杂度和视觉复杂度(特别是通过压缩比率评估)是主要决定性因素。DM在具有简单动作和视觉元素的数据环境中表现良好,而DT在动作和视觉复杂度更高的游戏中显示出优势。我们的发现有助于更深入地理解游戏特征如何影响序列建模强化学习中的性能差异, potentially指导未来模型设计和应用开发,以适应多样化且复杂的环境。
引用
@article{arxiv.2412.00725,
title = {Decision Transformer vs. Decision Mamba: Analysing the Complexity of Sequential Decision Making in Atari Games},
author = {Ke Yan},
journal= {arXiv preprint arXiv:2412.00725},
year = {2024}
}