终身策略复用与任务容量的重要性
机器学习
2023-11-07 v3 人工智能
神经与进化计算
摘要
人工智能中的一个长期挑战是终身强化学习,其中学习器依次面对许多任务,必须在任务间迁移知识并避免灾难性遗忘。策略复用及其他多策略强化学习技术可学习多个任务,但可能产生大量策略。本文提出两项新颖贡献:1)终身策略复用,一种与模型无关的策略复用算法,通过策略优化与自适应策略选择的结合,优化固定数量的近最优策略,从而避免产生大量策略;2)任务容量,即一个策略能准确求解的最大任务数的度量。对比两种最先进的基学习器,结果在 18 任务部分可观测 Pacman 领域及多达 125 任务的 Cartpole 领域上展示了终身策略复用与基于任务容量的预选择的重要性。
引用
@article{arxiv.2106.01741,
title = {Lifetime policy reuse and the importance of task capacity},
author = {David M. Bossens and Adam J. Sobey},
journal= {arXiv preprint arXiv:2106.01741},
year = {2023}
}