SALE:面向深度强化学习的状态-动作表示学习
机器学习
2023-11-07 v2 人工智能
机器学习
摘要
在强化学习(RL)领域,表示学习已被证明是处理复杂基于图像任务的有效工具,但在具有低层状态(如物理控制问题)的环境中常被忽视。本文提出 SALE,一种用于学习刻画状态与动作之间细微交互的嵌入的新方法,能够从低层状态中实现有效的表示学习。我们广泛研究了这些嵌入的设计空间并强调了重要的设计考量。我们将 SALE 及一种针对 RL 的 checkpoint 适配方法集成到 TD3 中,形成 TD7 算法,其显著优于现有的连续控制算法。在 OpenAI gym 基准任务上,TD7 在 300k 和 5M 时间步下相对于 TD3 的平均性能提升分别为 276.7% 和 50.7%,并且适用于在线与离线设置。
引用
@article{arxiv.2306.02451,
title = {For SALE: State-Action Representation Learning for Deep Reinforcement Learning},
author = {Scott Fujimoto and Wei-Di Chang and Edward J. Smith and Shixiang Shane Gu and Doina Precup and David Meger},
journal= {arXiv preprint arXiv:2306.02451},
year = {2023}
}
备注
NeurIPS 2023