中文

任务无关持续强化学习:获取洞见与克服挑战

机器学习 2023-05-19 v3

摘要

持续学习(CL)使得能够从一系列任务中学习并克服标准深度学习方法(如灾难性遗忘)局限性的模型和智能体得以发展。在这项工作中,我们研究了导致任务无关 CL 与多任务(MTL)智能体之间性能差异的因素。我们提出两个假设:(1)任务无关方法在有限数据、计算或高维度的设置中可能提供优势;(2)更快的适应在持续学习设置中可能特别有益,有助于缓解灾难性遗忘的影响。为研究这些假设,我们引入了一种用于任务无关 CL 智能体的基于回放循环的强化学习(3RL)方法。我们在合成任务以及包含 50 个独特操作任务的 Meta-World 基准上评估了 3RL。我们的结果表明,3RL 优于基线方法,甚至在高维度的挑战性设置中超越其多任务等价方法。我们还展示了循环任务无关智能体始终优于或匹配其基于 transformer 的对应物的性能。这些发现提供了关于任务无关 CL 相对于任务感知 MTL 方法优势的洞见,并突出了任务无关方法在资源受限、高维度和多任务环境中的潜力。

关键词

引用

@article{arxiv.2205.14495,
  title  = {Task-Agnostic Continual Reinforcement Learning: Gaining Insights and Overcoming Challenges},
  author = {Massimo Caccia and Jonas Mueller and Taesup Kim and Laurent Charlin and Rasool Fakoor},
  journal= {arXiv preprint arXiv:2205.14495},
  year   = {2023}
}