畅聊由你:动态提示词规划以延长对话轮次
计算与语言
2018-11-20 v1
摘要
构建开放域多轮对话系统是人工智能中最有趣且最具挑战性的任务之一。许多研究工作致力于构建此类对话系统,但鲜有探讨对进行中对话的对话流建模。此外,人们在对话中谈论高度相关的方面是常见现象,且话题连贯并自然漂移,这显示了对话流建模的必要性。为此,我们提出了基于强化学习方法的多轮提示词驱动对话系统(RLCw),其力求选择具有最大未来收益的自适应提示词,从而提升生成回复的质量。我们引入了一种新奖励,从有效性与相关性两方面衡量提示词的质量。为了进一步优化模型以适用于长期对话,本文采用了一种强化学习方法。在真实数据集上的实验表明,我们的模型在模拟轮次、多样性与人工评估方面持续优于一组具有竞争力的基线。
引用
@article{arxiv.1811.07631,
title = {Chat More If You Like: Dynamic Cue Words Planning to Flow Longer Conversations},
author = {Lili Yao and Ruijian Xu and Chao Li and Dongyan Zhao and Rui Yan},
journal= {arXiv preprint arXiv:1811.07631},
year = {2018}
}