中文

在连续控制在线强化学习中审视 Transformer

机器学习 2025-10-16 v1 人工智能 机器人学

摘要

尽管 Transformer 在离线或基于模型的强化学习(RL)中表现出色且受欢迎,但在在线无模型 RL 中仍鲜有被探索,由于其对训练设置和模型设计决策(例如如何构建策略和价值网络、共享组件或处理时间信息)敏感。在本文中,我们表明 Transformer 可作为连续控制在线无模型 RL 中的强基准。我们研究了关键设计问题:如何条件化输入、在 actor 和 critic 之间共享组件,以及如何对序列数据进行切片进行训练。我们的实验揭示了实现跨完全和部分可观测任务、以及在向量和图像设置中实现竞争性能的稳定架构和训练策略。这些发现为在线 RL 中应用 Transformer 提供了实用指导。

关键词

引用

@article{arxiv.2510.13367,
  title  = {A New Perspective on Transformers in Online Reinforcement Learning for Continuous Control},
  author = {Nikita Kachaev and Daniil Zelezetsky and Egor Cherepanov and Alexey K. Kovelev and Aleksandr I. Panov},
  journal= {arXiv preprint arXiv:2510.13367},
  year   = {2025}
}