面向提供图像反馈环境的协作式深度 $Q$ 学习框架
系统与控制
2021-10-29 v1 人工智能
机器学习
系统与控制
摘要
在本文中,我们通过一种双神经网络驱动的学习方法解决深度强化学习设定中的两个关键挑战:样本效率低与学习缓慢。在所提方法中,我们使用两个独立初始化的深度神经网络,在存在图像输入的情况下鲁棒地逼近动作值函数。特别地,我们开发了一种时序差分(TD)误差驱动的学习方法,其中引入一组 TD 误差的线性变换来直接更新深度神经网络各层的参数。我们从理论上证明,误差驱动学习(EDL)机制最小化的代价是经验代价的一个近似,且无论网络规模大小,该近似误差随学习推进而减小。通过仿真分析,我们表明所提方法实现了更快的学习与收敛,并需要更小的缓冲大小(从而提高了样本效率)。
引用
@article{arxiv.2110.15305,
title = {Cooperative Deep $Q$-learning Framework for Environments Providing Image Feedback},
author = {Krishnan Raghavan and Vignesh Narayanan and Jagannathan Sarangapani},
journal= {arXiv preprint arXiv:2110.15305},
year = {2021}
}