RNN 结构化预测中状态混叠的研究
机器学习
2019-06-25 v1 人工智能
计算与语言
摘要
端到端强化学习智能体同时学习状态表示与策略。循环神经网络(RNNs)已作为强化学习智能体在诸如对话等需要结构化预测的任务中成功训练。在本文中,我们研究了基于 RNN 的智能体在以策略梯度和基于价值的方法训练时所学到的表示。我们通过大量实验与分析表明,当以策略梯度训练时,在需在不同状态下采取相同动作的设置中,循环神经网络往往无法学到导向最优策略的状态表示。为解释这一失败,我们强调了状态混叠问题,即在表示空间中将两种或更多不同状态混淆。我们证明,当若干状态共享相同最优动作且智能体通过策略梯度训练时,状态混叠就会发生。我们通过简单迷宫设定和更复杂的基于文本的游戏中的实验刻画了该现象,并对以强化学习训练 RNN 提出了建议。
引用
@article{arxiv.1906.09310,
title = {A Study of State Aliasing in Structured Prediction with RNNs},
author = {Layla El Asri and Adam Trischler},
journal= {arXiv preprint arXiv:1906.09310},
year = {2019}
}
备注
Deep Reinforcement Learning Meets Structured Prediction workshop at ICLR 2019 and Representation Learning for NLP workshop at ACL 2019