用于训练神经对话模型的受控且具观点与知识的电影讨论语料库
计算与语言
2020-03-31 v1
摘要
已知用于非目标导向对话的完全数据驱动聊天机器人在其多轮对话中存在不一致行为,这源于对其假定背景人格与事实知识等参数难以控制。原因之一是有标签数据的相对缺乏,而从中本可同时学习人格一致性与事实使用以及对话行为。为此,我们引入一个电影讨论领域的新标签对话数据集,其中每个对话都基于预先指定的事实与观点。我们彻底验证了所收集对话中参与者对其给定事实与观点画像的遵循情况,并发现这方面的总体质量很高。该过程还为我们提供了一层潜在的有助于训练模型的额外标注。我们引入了一个在此数据上训练的端到端自注意力解码器模型作为基线,并表明其能够生成被判断为自然、有知识且表现出关注度的观点性回复。
引用
@article{arxiv.2003.13342,
title = {A Corpus of Controlled Opinionated and Knowledgeable Movie Discussions for Training Neural Conversation Models},
author = {Fabian Galetzka and Chukwuemeka U. Eneh and David Schlangen},
journal= {arXiv preprint arXiv:2003.13342},
year = {2020}
}
备注
8 Pages, 8 Figures, 5 Tables. Accepted paper for LREC 2020 conference