中文

面向离线后见信息匹配的广义决策Transformer

机器学习 2022-02-07 v3 人工智能 机器学习

摘要

如何从每条轨迹数据中提取尽可能多的学习信号一直是强化学习(RL)中的一个关键问题,其中样本效率低下对实际应用构成了严峻挑战。近期工作表明,使用富有表现力的策略函数逼近器并以未来轨迹信息为条件——例如后见经验回放中的未来状态或决策Transformer(DT)中的回报到go(returns-to-go)——能够实现多任务策略的高效学习,有时在线RL被完全替换为离线行为克隆,例如序列建模。我们证明所有这些方法都在做后见信息匹配(HIM)——训练能够输出与未来状态信息的某些统计量相匹配的轨迹其余部分的策略。我们提出广义决策Transformer(GDT)来求解任意HIM问题,并展示特征函数与反因果聚合器的不同选择不仅将DT作为特例恢复,还带来了用于匹配不同未来统计量的新颖分类DT(CDT)和双向DT(BDT)。为评估CDT和BDT,我们定义离线多任务状态边缘匹配(SMM)和模仿学习(IL)作为两个通用的HIM问题,提出Wasserstein距离损失作为二者的度量,并在MuJoCo连续控制基准上进行了实证研究。CDT仅在DT中将反因果求和替换为反因果分箱,实现了首个有效的离线多任务SMM算法,能很好地泛化到未见过的甚至合成的多模态状态特征分布。BDT使用反因果第二个transformer作为聚合器,可学习建模任意未来统计量,并在离线多任务IL中优于DT变体。我们基于HIM和GDT的广义表述极大地拓展了强大序列建模架构在现代RL中的作用。

关键词

引用

@article{arxiv.2111.10364,
  title  = {Generalized Decision Transformer for Offline Hindsight Information Matching},
  author = {Hiroki Furuta and Yutaka Matsuo and Shixiang Shane Gu},
  journal= {arXiv preprint arXiv:2111.10364},
  year   = {2022}
}

备注

Accepted to ICLR2022, Spotlight. Website: https://sites.google.com/view/generalizeddt and Code: https://github.com/frt03/generalized_dt