中文

终身策略复用与任务容量的重要性

机器学习 2023-11-07 v3 人工智能 神经与进化计算

摘要

人工智能中的一个长期挑战是终身强化学习,其中学习器依次面对许多任务,必须在任务间迁移知识并避免灾难性遗忘。策略复用及其他多策略强化学习技术可学习多个任务,但可能产生大量策略。本文提出两项新颖贡献:1)终身策略复用,一种与模型无关的策略复用算法,通过策略优化与自适应策略选择的结合,优化固定数量的近最优策略,从而避免产生大量策略;2)任务容量,即一个策略能准确求解的最大任务数的度量。对比两种最先进的基学习器,结果在 18 任务部分可观测 Pacman 领域及多达 125 任务的 Cartpole 领域上展示了终身策略复用与基于任务容量的预选择的重要性。

关键词

引用

@article{arxiv.2106.01741,
  title  = {Lifetime policy reuse and the importance of task capacity},
  author = {David M. Bossens and Adam J. Sobey},
  journal= {arXiv preprint arXiv:2106.01741},
  year   = {2023}
}