刻画深度 Q 学习中的动作泛化鸿沟
人工智能
2022-05-12 v1 机器学习
摘要
我们研究了深度 Q 学习在离散动作空间中的动作泛化能力。泛化对于高效的强化学习(RL)至关重要,因为它使智能体能够将在过去经验中学到的知识用于新任务。尽管函数逼近为深度 RL 智能体提供了一种对状态输入进行泛化的自然方式,但同样的泛化机制并不适用于离散动作输出。然而令人惊讶的是,我们的实验表明,使用恰好此类函数逼近器的深度 Q 网络(DQN)仍能够实现一定程度的动作泛化。我们的主要贡献有两点:首先,我们提出了一种利用动作相似性的专家知识来评估动作泛化的方法,并经验性地证实动作泛化可带来更快的学习;其次,我们在不同领域中刻画了动作泛化鸿沟(DQN 与专家之间学习性能的差距)。我们发现 DQN 确实能在若干简单领域中对动作进行泛化,但其泛化能力随着动作空间增大而下降。
引用
@article{arxiv.2205.05588,
title = {Characterizing the Action-Generalization Gap in Deep Q-Learning},
author = {Zhiyuan Zhou and Cameron Allen and Kavosh Asadi and George Konidaris},
journal= {arXiv preprint arXiv:2205.05588},
year = {2022}
}
备注
To appear at the 5th Multidisciplinary Conference on Reinforcement Learning and Decision Making (RLDM2022)