CtrlFormer:通过 Transformer 学习可迁移的视觉控制状态表示
计算机视觉与模式识别
2022-06-20 v1 人工智能
机器学习
摘要
Transformer 在学习视觉和语言表示方面取得了巨大成功,这种表示可通用于各种下游任务。在视觉控制中,学习能够在不同控制任务之间迁移的可迁移状态表示,对于减少训练样本量至关重要。然而,将 Transformer 移植到样本高效的视觉控制中仍然是一个具有挑战性且尚未解决的问题。为此,我们提出了一种新颖的控制 Transformer (CtrlFormer),它具有许多先前方法所不具备的吸引人的优点。首先,CtrlFormer 在不同控制任务中联合学习视觉令牌与策略令牌之间的自注意力机制,从而可以学习并迁移多任务表示,而不会发生灾难性遗忘。其次,我们精心设计了一种对比强化学习范式来训练 CtrlFormer,使其能够实现高样本效率,这在控制问题中至关重要。例如,在 DMControl 基准测试中,与近期一些先进方法在使用 100k 样本进行迁移学习后在“Cartpole”任务中得分为零的失败情况不同,CtrlFormer 仅用 100k 样本就能达到最先进的分数,同时保持先前任务的性能。代码和模型已在我们的项目主页发布。
引用
@article{arxiv.2206.08883,
title = {CtrlFormer: Learning Transferable State Representation for Visual Control via Transformer},
author = {Yao Mu and Shoufa Chen and Mingyu Ding and Jianyu Chen and Runjian Chen and Ping Luo},
journal= {arXiv preprint arXiv:2206.08883},
year = {2022}
}
备注
ICML 2022