中文

Q-Transformer:通过自回归 Q 函数实现可扩展离线强化学习

机器人学 2023-10-18 v2 人工智能 机器学习

摘要

本工作中,我们提出一种可扩展的强化学习方法,用于从大型离线数据集训练多任务策略,该数据集可同时利用人类演示与自主收集数据。我们的方法使用 Transformer 为通过离线时序差分备份训练的 Q 函数提供可扩展表示。因此我们称该方法为 Q-Transformer。通过对每个动作维度离散化并将各动作维度的 Q 值表示为独立 token,我们可对 Q 学习应用高效高容量序列建模技术。我们给出了若干使离线 RL 训练获得良好性能的设计决策,并展示 Q-Transformer 在大型多样化真实世界机器人操纵任务套件上优于先前离线 RL 算法与模仿学习技术。项目网站与视频见 https://qtransformer.github.io

关键词

引用

@article{arxiv.2309.10150,
  title  = {Q-Transformer: Scalable Offline Reinforcement Learning via Autoregressive Q-Functions},
  author = {Yevgen Chebotar and Quan Vuong and Alex Irpan and Karol Hausman and Fei Xia and Yao Lu and Aviral Kumar and Tianhe Yu and Alexander Herzog and Karl Pertsch and Keerthana Gopalakrishnan and Julian Ibarz and Ofir Nachum and Sumedh Sontakke and Grecia Salazar and Huong T Tran and Jodilyn Peralta and Clayton Tan and Deeksha Manjunath and Jaspiar Singht and Brianna Zitkovich and Tomas Jackson and Kanishka Rao and Chelsea Finn and Sergey Levine},
  journal= {arXiv preprint arXiv:2309.10150},
  year   = {2023}
}

备注

See website at https://qtransformer.github.io