中文

一种面向深度强化学习系统的有意遗忘驱动自愈方法

机器学习 2023-08-25 v1 人工智能 软件工程 机器学习

摘要

深度强化学习(DRL)正日益应用于 Netflix 与 Facebook 等大规模生产系统。与多数数据驱动系统一样,DRL 系统可能因环境漂移而表现出不良行为,这类漂移常发生于不断变化的生产环境中。持续学习(CL)是使 DRL 智能体适应环境状态偏移的固有自愈方法。然而,连续发生的较大幅度偏移可能使生产环境偏离其原始状态。近期研究表明,这些环境漂移往往将 CL 带入漫长甚至失败的自愈周期,其源于灾难性遗忘、热启动失败与收敛缓慢等低效问题。本文中,我们提出 Dr. DRL,一种有效的 DRL 系统自愈方法,它将一种新颖的有意遗忘机制集成到原始 CL 中以克服其主要问题。Dr. DRL 刻意擦除 DRL 系统的次要行为,从而系统性地优先适配关键问题解决技能。使用成熟的 DRL 算法,Dr. DRL 在各种漂移环境中与原始 CL 进行比较。Dr. DRL 平均能将自愈时间与微调回合分别减少 18.74% 与 17.72%。Dr. DRL 成功帮助智能体适配了原始 CL 未解决的 19.63% 的漂移环境,同时对两种方法均解决的漂移环境,所获奖励维持不变甚至提升高达 45%。

关键词

引用

@article{arxiv.2308.12445,
  title  = {An Intentional Forgetting-Driven Self-Healing Method For Deep Reinforcement Learning Systems},
  author = {Ahmed Haj Yahmed and Rached Bouchoucha and Houssem Ben Braiek and Foutse Khomh},
  journal= {arXiv preprint arXiv:2308.12445},
  year   = {2023}
}

备注

Accepted for publication in The 38th IEEE/ACM International Conference on Automated Software Engineering (ASE 2023)