策略的分层管弦乐
机器学习
2024-11-06 v1 人工智能
摘要
持续强化学习面临重大挑战,因为智能体在学习顺序任务时倾向于经历灾难性遗忘。在本文中,我们提出了一种基于模块化的方法——分层策略管弦乐(HOP),旨在缓解终身强化学习中的灾难性遗忘。HOP基于当前观测与先前在成功任务中遇到的观测之间的相似性度量,动态构建策略层次结构。与其他最先进方法不同,HOP不需要任务标签,允许在任务边界模糊的环境中实现鲁棒适应。我们在程序化生成的环境套件中的多个任务上进行的实验表明,HOP在跨任务知识保留方面显著优于基线方法,其性能与需要任务标签的最先进迁移方法相当。此外,HOP在任务保持不变时不会损害性能,突显了其多功能性。
引用
@article{arxiv.2411.03008,
title = {Hierarchical Orchestra of Policies},
author = {Thomas P Cannon and Özgür Simsek},
journal= {arXiv preprint arXiv:2411.03008},
year = {2024}
}
备注
Accepted as a poster. NeurIPS IMOL