中文

GoChat:基于分层强化学习的目标导向聊天机器人

计算与语言 2020-05-27 v2 人工智能

摘要

一个像人类一样对话的聊天机器人应该是目标导向的(即在对话中有目的性),这超越了语言生成的范畴。然而,现有的对话系统通常严重依赖繁琐的手工规则或昂贵的标注数据集来达成目标。本文提出了目标导向聊天机器人(GoChat),这是一个端到端训练聊天机器人的框架,旨在最大化来自离线多轮对话数据集的长期回报。我们的框架利用分层强化学习(HRL),其中高层策略通过确定一些子目标来引导对话走向最终目标,而低层策略则通过生成相应的回复话语来完成子目标。我们在一个真实的金融反欺诈对话数据集上进行了实验,结果表明,我们的方法在回复生成质量和目标达成成功率方面均优于先前的方法。

关键词

引用

@article{arxiv.2005.11729,
  title  = {GoChat: Goal-oriented Chatbots with Hierarchical Reinforcement Learning},
  author = {Jianfeng Liu and Feiyang Pan and Ling Luo},
  journal= {arXiv preprint arXiv:2005.11729},
  year   = {2020}
}