Transformer 何时在强化学习中表现出色?解耦记忆与信用分配
机器学习
2023-11-06 v4
摘要
强化学习(RL)算法面临两个截然不同的挑战:学习对过去与当前观测的有效表征,以及确定动作如何影响未来回报。两项挑战均涉及对长期依赖的建模。Transformer 架构在解决涉及长期依赖的问题上非常成功,包括在 RL 领域。然而,基于 Transformer 的 RL 方法性能强劲的深层原因仍不清楚:是因为它们学习了有效记忆,还是因为它们执行了有效的信用分配?在引入记忆长度与信用分配长度的正式定义后,我们设计了简单的可配置任务来度量这些不同量。我们的实证结果揭示,Transformer 能够增强 RL 算法的记忆能力,可扩展至需要记住 1500 步前观测的任务。然而,Transformer 并未改善长期信用分配。总之,我们的结果为 Transformer 在 RL 中的成功提供了解释,同时也指出了未来研究与基准设计的一个重要方向。我们的代码已开源:https://github.com/twni2016/Memory-RL
引用
@article{arxiv.2307.03864,
title = {When Do Transformers Shine in RL? Decoupling Memory from Credit Assignment},
author = {Tianwei Ni and Michel Ma and Benjamin Eysenbach and Pierre-Luc Bacon},
journal= {arXiv preprint arXiv:2307.03864},
year = {2023}
}
备注
NeurIPS 2023 (Oral)