用于对话管理的基于监督数据的样本高效 Actor-Critic 强化学习
计算与语言
2017-07-06 v2 人工智能
机器学习
摘要
深度强化学习(RL)方法在对话策略优化方面具有显著潜力。然而,它们在学习的早期阶段表现不佳。这对于与真实用户的在线学习尤为成问题。引入两种方法来解决该问题。首先,为加速学习过程,提出两种样本高效的神经网络算法:带经验回放的信域 actor-critic (TRACER) 与带经验回放的周期自然 actor-critic (eNACER)。对于 TRACER,信域有助于控制学习步长并避免灾难性模型改变。对于 eNACER,自然梯度确定策略空间中最速上升方向以加速收敛。两种模型均采用带经验回放的非策略学习以提高样本效率。其次,为缓解冷启动问题,利用演示数据语料库在在线强化学习之前预训练模型。结合这两种方法,我们展示了一种学习基于深度 RL 的对话策略的实用方法,并展示了它们在任务导向信息寻求领域的有效性。
引用
@article{arxiv.1707.00130,
title = {Sample-efficient Actor-Critic Reinforcement Learning with Supervised Data for Dialogue Management},
author = {Pei-Hao Su and Pawel Budzianowski and Stefan Ultes and Milica Gasic and Steve Young},
journal= {arXiv preprint arXiv:1707.00130},
year = {2017}
}
备注
Accepted as a long paper in SigDial 2017