基于知识蒸馏与自主规则发现的高效开放世界强化学习
人工智能
2023-11-27 v1
摘要
深度强化学习存在灾难性遗忘与样本效率低的问题,使其难以适用于不断变化的真实世界。然而,利用先前习得知识的能力对于 AI 智能体快速适应新异环境至关重要。通常,智能体在先前交互中观察到的某些空间信息可用于推断特定任务的规则。推断出的规则随后可帮助智能体在先前未见过状态中避免潜在危险情形,并引导学习过程以提高其新异适应速度。本工作中,我们提出一个适用于深度强化学习智能体的通用框架。该框架为智能体提供一种在 novel 环境中自主发现特定任务规则并自我监督其学习的方式。我们给出规则驱动的深度 Q 学习智能体(RDQ)作为该框架的一种可能实现。我们表明 RDQ 在与世界交互时成功提取特定任务规则,并利用它们大幅提升其学习效率。在实验中,我们展示 RDQ 智能体比基线智能体对新异情形具有显著更强的韧性,并能更快地检测并适应新情形。
引用
@article{arxiv.2311.14270,
title = {Efficient Open-world Reinforcement Learning via Knowledge Distillation and Autonomous Rule Discovery},
author = {Ekaterina Nikonova and Cheng Xue and Jochen Renz},
journal= {arXiv preprint arXiv:2311.14270},
year = {2023}
}