PDiT: 用于深度强化学习的感知与决策交错Transformer
机器学习
2023-12-27 v1 人工智能
机器人学
系统与控制
系统与控制
摘要
设计更好的深度网络和更好的强化学习算法对于深度强化学习都很重要。本文研究前者。具体地,提出了感知与决策交错Transformer(PDiT)网络,它以非常自然的方式级联两个Transformer:感知Transformer通过处理补丁级别的观察来关注环境感知,而决策Transformer通过条件化于期望回报的历史、感知器的输出和动作来关注决策制定。这种网络设计普遍适用于许多深度强化学习设置,例如,在图像观察、本体感觉观察或混合图像-语言观察环境下的在线和离线强化学习算法。大量实验表明,PDiT不仅能在不同设置下取得优于强基线的性能,还能提取可解释的特征表示。我们的代码可在https://github.com/maohangyu/PDiT获取。
引用
@article{arxiv.2312.15863,
title = {PDiT: Interleaving Perception and Decision-making Transformers for Deep Reinforcement Learning},
author = {Hangyu Mao and Rui Zhao and Ziyue Li and Zhiwei Xu and Hao Chen and Yiqun Chen and Bin Zhang and Zhen Xiao and Junge Zhang and Jiangjin Yin},
journal= {arXiv preprint arXiv:2312.15863},
year = {2023}
}
备注
Proc. of the 23rd International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2024, full paper with oral presentation). Cover our preliminary study: arXiv:2212.14538