基于强化学习专用GAN对应函数的深度强化学习知识迁移
机器学习
2024-11-12 v2 人工智能
摘要
深度强化学习在复杂决策任务中已展现出超越人类的表现,但它在泛化与知识复用——真正智能的关键方面——上存在困难。本文提出一种新方法,专门修改Cycle生成对抗网络(Cycle Generative Adversarial Networks)以用于强化学习,实现两个任务间有效的一对一知识迁移。我们的方法以两个新组件增强损失函数:模型损失,捕捉源任务与目标任务间的动态关系;以及Q损失,识别对目标决策策略有显著影响的状态。在2-D Atari游戏Pong上测试,我们的方法在相同任务中实现了100%知识迁移,而对于旋转任务,依据网络架构不同,实现了100%知识迁移或训练时间减少30%。相比之下,使用标准生成对抗网络(Generative Adversarial Networks, GAN)或Cycle生成对抗网络在多数情况下导致比从头训练更差的性能。结果表明所提方法确保了深度强化学习中增强的知识泛化。
引用
@article{arxiv.2209.06604,
title = {Knowledge Transfer in Deep Reinforcement Learning via an RL-Specific GAN-Based Correspondence Function},
author = {Marko Ruman and Tatiana V. Guy},
journal= {arXiv preprint arXiv:2209.06604},
year = {2024}
}
备注
25 pages