中文

基于策略梯度的端到端离线面向目标对话策略学习

人工智能 2017-12-11 v1 计算与语言 机器学习

摘要

面向目标的对话策略学习通常通过有监督学习算法离线进行,或通过强化学习(RL)在线进行。此外,随着公司积累大量客户与训练有素的人工坐席之间的对话转录文本,编码器-解码器方法日益流行,因为坐席话语可直接作为监督信号,无需话语级标注。然而,此类方法的一个潜在缺陷是它们短视地生成下一句坐席话语,而不考虑对话层面的因素。为解决该问题,本文提出一种从非标注语料中学习的离线RL方法,可在话语和对话两个层面优化面向目标的策略。我们引入了一种新颖的奖励函数,并使用同策略与异策略策略梯度离线学习策略,无需在线用户交互或显式状态空间定义。

关键词

引用

@article{arxiv.1712.02838,
  title  = {End-to-End Offline Goal-Oriented Dialog Policy Learning via Policy Gradient},
  author = {Li Zhou and Kevin Small and Oleg Rokhlenko and Charles Elkan},
  journal= {arXiv preprint arXiv:1712.02838},
  year   = {2017}
}

备注

Workshop on Conversational AI, NIPS 2017, Long Beach, CA, USA