用于改进神经对话模型的批量策略梯度方法
机器学习
2017-02-14 v1 机器学习
摘要
我们研究具有循环神经网络架构的聊天机器人在奖励噪声大且获取代价高昂时的强化学习。例如,用于自动化客户服务的聊天机器人可由质量保证代理评分,但此过程可能代价高昂、耗时且噪声大。先前用于自然语言处理的强化学习工作使用同策略更新和/或针对在线学习设置设计。我们通过经验证明此类策略不适用于该设置,并开发了离策略批量策略梯度方法(BPG)。我们通过一系列合成实验以及在一个餐厅推荐数据集上的Amazon Mechanical Turk实验证明了我们方法的有效性。
引用
@article{arxiv.1702.03334,
title = {Batch Policy Gradient Methods for Improving Neural Conversation Models},
author = {Kirthevasan Kandasamy and Yoram Bachrach and Ryota Tomioka and Daniel Tarlow and David Carter},
journal= {arXiv preprint arXiv:1702.03334},
year = {2017}
}
备注
International Conference on Learning Representations (ICLR) 2017