中文

通过从像素进行的连续控制看强化学习中的高方差是否不可避免?

计算机视觉与模式识别 2021-10-22 v1

摘要

强化学习(RL)实验以高方差而臭名昭著,且细微细节会对测量结果产生不成比例的大影响。这对于创建可复现的研究是有问题的,并且也作为实际应用的障碍,因为安全性和可预测性至关重要。在本文中,我们调查了这种感知不稳定性的原因。为了允许深入分析,我们聚焦于一个特别流行且高方差的设置——使用actor-critic智能体从像素进行连续控制。在此设置中,我们证明方差主要出现在训练早期,是糟糕的“离群”运行的结果,但权重初始化和初始探索并非罪魁祸首。我们表明早期方差的一个原因是导致非线性饱和的数值不稳定性。我们研究了该问题的几种修复方法,并发现一种特定方法出奇地有效且简单——归一化倒数第二层特征。解决学习不稳定性允许更大的学习率,并显著减少结果的方差。这表明RL中感知到的方差不一定是该问题定义所固有的,并可能通过简单的架构修改来解决。

关键词

引用

@article{arxiv.2110.11223,
  title  = {Detection of Driver Drowsiness by Calculating the Speed of Eye Blinking},
  author = {Muhammad Fawwaz Yusri and Patrick Mangat and Oliver Wasenmüller},
  journal= {arXiv preprint arXiv:2110.11223},
  year   = {2021}
}

备注

This paper has been accepted at the Upper-Rhine Artificial Intelligence Symposium 2021