从弱示范中学习对话策略
计算与语言
2020-08-14 v2 机器学习
神经与进化计算
摘要
深度强化学习是训练对话管理器的一种有前景的方法,但当前方法在处理多领域对话系统的大状态空间和动作空间时面临困难。基于在困难 Atari 游戏中取得高分的示范深度 Q 学习(DQfD)算法,我们利用对话数据引导智能体成功响应用户请求。我们对所需数据的假设逐渐减少,使用有标注、少标注甚至无标注数据来训练专家示范者。我们引入了强化微调学习(Reinforced Fine-tune Learning),作为 DQfD 的扩展,使我们能够克服数据集与环境之间的领域鸿沟。在一个具有挑战性的多领域对话系统框架中的实验验证了我们的方法,并且即使在领域外数据上训练也能获得高成功率。
引用
@article{arxiv.2004.11054,
title = {Learning Dialog Policies from Weak Demonstrations},
author = {Gabriel Gordon-Hall and Philip John Gorinski and Shay B. Cohen},
journal= {arXiv preprint arXiv:2004.11054},
year = {2020}
}
备注
9 pages + 2 pages references + 1 page appendices, 6 figures, 2 tables, 1 algorithm, accepted as long paper at ACL2020