从失败中学习的面向目标对话策略
人工智能
2018-11-26 v2 计算与语言
摘要
强化学习方法已被用于学习对话策略。然而,学习有效的对话策略经常需要数量多到 prohibitive 的对话。这部分是由于对话中的稀疏奖励,以及早期学习阶段极少成功对话所致。后见之明经验回放(HER)能够从失败中学习,但原始HER由于隐含目标而不适用于对话学习。在本工作中,我们开发了两种复杂的HER方法,提供复杂度与性能之间的不同权衡,并首次实现了基于HER的对话策略学习。使用真实用户模拟器的实验表明,我们的HER方法在学习率上优于现有的经验回放方法(应用于深度Q网络)。
引用
@article{arxiv.1808.06497,
title = {Goal-oriented Dialogue Policy Learning from Failures},
author = {Keting Lu and Shiqi Zhang and Xiaoping Chen},
journal= {arXiv preprint arXiv:1808.06497},
year = {2018}
}