中文

关于微调与元强化学习有效性的比较

机器学习 2023-02-17 v2 人工智能 计算机视觉与模式识别 机器人学

摘要

智能体应具备从先前学习任务中汲取知识以快速高效学习新任务的能力。元学习方法已成为实现此目标的热门方案。然而,元强化学习(meta-RL)算法迄今仍局限于具有狭窄任务分布的简单环境。此外,在监督学习与自监督学习中,预训练后微调以适应新任务的范式已成为一种简单而有效的方案。这让人质疑元学习方法在强化学习中的益处,因其通常伴随高复杂性代价。因此我们于多种基于视觉的基准(包括 Procgen、RLBench 和 Atari)中研究 meta-RL 方法,评估在全新任务上进行。我们的发现表明,当元学习方法在不同任务(而非同一任务的不同变体)上评估时,多任务预训练加新任务微调的表现与元预训练加元测试时适应相当或更好。这对未来研究是鼓舞人心的,因为多任务预训练往往比 meta-RL 更简单且计算更便宜。基于这些发现,我们主张在未来的 meta-RL 方法评估中使用更具挑战性的任务,并将多任务预训练加微调作为一个简单而强大的基线纳入。

关键词

引用

@article{arxiv.2206.03271,
  title  = {On the Effectiveness of Fine-tuning Versus Meta-reinforcement Learning},
  author = {Zhao Mandi and Pieter Abbeel and Stephen James},
  journal= {arXiv preprint arXiv:2206.03271},
  year   = {2023}
}