在 Atari 游戏中使用生成对抗网络进行深度强化学习的特征提取
摘要
深度强化学习(DRL)已成功应用于机器人导航和自动视频游戏播放等多个研究领域。然而,这些方法需要与环境进行过度的计算和交互,因此需要提高样本效率。产生这一要求的主要原因是,稀疏和延迟的奖励不能为深度神经网络的表示学习提供有效的监督。在本研究中,近端策略优化(PPO)算法通过生成对抗网络(GAN)进行增强,通过强制网络在不依赖稀疏和延迟奖励作为监督的情况下学习有效的表示,从而提高样本效率。结果表明,通过将 DRL 智能体与 GAN 判别器联合训练,可以获得提升的性能。---- Derin Pekistirmeli Ogrenme, robot navigasyonu ve otomatiklestirilmis video oyunu oynama gibi arastirma alanlarinda basariyla uygulanmaktadir. Ancak, kullanilan yontemler ortam ile fazla miktarda etkilesim ve hesaplama gerektirmekte ve bu nedenle de ornek verimliligi yonunden iyilestirmelere ihtiyac duyulmaktadir. Bu gereksinimin en onemli nedeni, gecikmeli ve seyrek odul sinyallerinin derin yapay sinir aglarinin etkili betimlemeler ogrenebilmesi icin yeterli bir denetim saglayamamasidir. Bu calismada, Proksimal Politika Optimizasyonu algoritmasi Uretici Cekismeli Aglar (UCA) ile desteklenerek derin yapay sinir aglarinin seyrek ve gecikmeli odul sinyallerine bagimli olmaksizin etkili betimlemeler ogrenmesi tesvik edilmektedir. Elde edilen sonuclar onerilen algoritmanin ornek verimliliginde artis elde ettigini gostermektedir.
引用
@article{arxiv.2004.02762,
title = {Using Generative Adversarial Nets on Atari Games for Feature Extraction in Deep Reinforcement Learning},
author = {Ayberk Aydın and Elif Surer},
journal= {arXiv preprint arXiv:2004.02762},
year = {2020}
}
备注
in Turkish