中文

不同模态预训练对 Transformer 在离线强化学习中微调的影响

机器学习 2022-11-21 v1 机器学习

摘要

我们通过实证研究了在语言、视觉等不同模态数据上的预训练,如何影响基于 Transformer 的模型向 Mujoco 离线强化学习任务的微调。对内部表示的剖析表明,预训练 Transformer 在预训练前后获得了差异很大的表示,但在微调中获取的数据信息少于随机初始化模型。对预训练 Transformer 参数变化的细致观察显示,其参数变化不大,且使用图像数据预训练的模型性能不佳可能部分源于大梯度和梯度裁剪。为研究使用语言数据预训练的 Transformer 所利用的信息,我们在不提供上下文的情况下对该模型进行微调,发现即便没有上下文信息模型也能高效学习。后续的跟进分析支持了如下假设:语言数据预训练可能使 Transformer 获得类上下文信息,并利用其解决下游任务。

关键词

引用

@article{arxiv.2211.09817,
  title  = {On the Effect of Pre-training for Transformer in Different Modality on Offline Reinforcement Learning},
  author = {Shiro Takagi},
  journal= {arXiv preprint arXiv:2211.09817},
  year   = {2022}
}

备注

48 pages. Published in NeurIPS 2022