一种面向深度强化学习系统的有意遗忘驱动自愈方法
机器学习
2023-08-25 v1 人工智能
软件工程
机器学习
摘要
深度强化学习(DRL)正日益应用于 Netflix 与 Facebook 等大规模生产系统。与多数数据驱动系统一样,DRL 系统可能因环境漂移而表现出不良行为,这类漂移常发生于不断变化的生产环境中。持续学习(CL)是使 DRL 智能体适应环境状态偏移的固有自愈方法。然而,连续发生的较大幅度偏移可能使生产环境偏离其原始状态。近期研究表明,这些环境漂移往往将 CL 带入漫长甚至失败的自愈周期,其源于灾难性遗忘、热启动失败与收敛缓慢等低效问题。本文中,我们提出 Dr. DRL,一种有效的 DRL 系统自愈方法,它将一种新颖的有意遗忘机制集成到原始 CL 中以克服其主要问题。Dr. DRL 刻意擦除 DRL 系统的次要行为,从而系统性地优先适配关键问题解决技能。使用成熟的 DRL 算法,Dr. DRL 在各种漂移环境中与原始 CL 进行比较。Dr. DRL 平均能将自愈时间与微调回合分别减少 18.74% 与 17.72%。Dr. DRL 成功帮助智能体适配了原始 CL 未解决的 19.63% 的漂移环境,同时对两种方法均解决的漂移环境,所获奖励维持不变甚至提升高达 45%。
引用
@article{arxiv.2308.12445,
title = {An Intentional Forgetting-Driven Self-Healing Method For Deep Reinforcement Learning Systems},
author = {Ahmed Haj Yahmed and Rached Bouchoucha and Houssem Ben Braiek and Foutse Khomh},
journal= {arXiv preprint arXiv:2308.12445},
year = {2023}
}
备注
Accepted for publication in The 38th IEEE/ACM International Conference on Automated Software Engineering (ASE 2023)