中文

策略诱导的自监督改善视觉强化学习中的表征微调

机器学习 2023-02-14 v1 计算机视觉与模式识别

摘要

我们研究如何将源任务上预训练的表征迁移到基于视觉感知的强化学习任务的目标任务中。我们分析了两种流行方法:冻结或微调预训练表征。在一系列流行任务上的实证研究发现预训练表征的若干性质。首先,即使预训练表征完美捕获了解决目标任务所需的信息,仍需微调。其次,微调后的表征提升了可学习性且对噪声更鲁棒。第三,预训练底层与任务无关,可轻易迁移至新任务,而顶层编码任务特定信息并需要适配。基于这些洞察,我们提出了一种自监督目标,其依据表征所诱导的策略(而非传统的与策略无关的表征相似性度量,如欧氏范数、余弦相似度)对表征进行聚类。结合冻结底层,该目标在广泛基准上显著优于冻结、微调和自监督等替代方案。

关键词

引用

@article{arxiv.2302.06009,
  title  = {Policy-Induced Self-Supervision Improves Representation Finetuning in Visual RL},
  author = {Sébastien M. R. Arnold and Fei Sha},
  journal= {arXiv preprint arXiv:2302.06009},
  year   = {2023}
}