面向任务的神经对话模型的对抗学习
计算与语言
2018-05-31 v1
摘要
在这项工作中,我们提出一种对抗学习方法,用于基于强化学习(RL)的面向任务对话模型中的奖励估计。当前大多数基于RL的面向任务对话系统需要访问来自用户反馈或用户评分的奖励信号。然而,此类用户评分在实践中可能并不总是一致或可用。此外,采用RL的在线对话策略学习通常需要大量用户查询,存在样本效率问题。为应对这些挑战,我们提出一种对抗学习方法来直接从对话样本中学习对话奖励。此类奖励进一步用于通过基于策略梯度的RL优化对话策略。在餐厅搜索领域的评估中,我们表明所提出的对抗对话学习方法相比强基线方法取得了更高的对话成功率。我们进一步讨论了在线对抗对话学习中的协变量偏移问题,并展示我们如何借助对用户反馈的部分访问来解决该问题。
引用
@article{arxiv.1805.11762,
title = {Adversarial Learning of Task-Oriented Neural Dialog Models},
author = {Bing Liu and Ian Lane},
journal= {arXiv preprint arXiv:1805.11762},
year = {2018}
}
备注
To appear at SIGDIAL 2018