中文

由后见之链经验涌现的具主体性 Transformer

机器学习 2023-05-29 v1

摘要

由多样数据与模型规模驱动的大型 transformer 模型已主导自然语言建模与计算机视觉,并推进了多个 AI 领域的前沿。在强化学习(RL)中,尽管已有诸多基于 transformer 策略的努力,一个关键局限在于当前基于 transformer 的策略无法通过直接结合多个次优试验的信息来学习。本工作中,我们利用近期提出的后见之链(chain of hindsight)对经验重新标注以解决此问题,即将一个 transformer 训练于按总回报升序排列的轨迹经验序列上。我们的方法包括将每条轨迹的目标回报重新标注为轨迹序列中的最大总回报,并训练一个自回归模型,以过去状态、动作、回报、目标回报和任务完成标记为条件预测动作;所得模型 Agentic Transformer(AT)能够在训练与测试时自我改进。正如我们在 D4RL 与 ExoRL 基准上所示,据我们所知,这是简单基于 transformer 的模型首次能与基于时序差分与模仿学习的方法竞争,即便仅从次优数据出发。我们的 Agentic Transformer 还展现出有前景的缩放趋势:更大的模型一致地改善结果。

关键词

引用

@article{arxiv.2305.16554,
  title  = {Emergent Agentic Transformer from Chain of Hindsight Experience},
  author = {Hao Liu and Pieter Abbeel},
  journal= {arXiv preprint arXiv:2305.16554},
  year   = {2023}
}

备注

International Conference on Machine Learning (ICML) 2023