中文

从自然语言反馈的对抗性修改中学习即兴聊天机器人

计算与语言 2020-10-16 v2 人工智能 机器学习

摘要

聊天机器人的普遍存在及其与用户的交互产生了大量数据。我们能否利用这些数据改进聊天机器人?自馈聊天机器人通过在用户对响应不满意时询问自然语言反馈,并将该反馈用作额外的训练样本来自我改进。然而,大多数情况下的用户反馈包含无关序列,阻碍了其作为训练样本的效用。在这项工作中,我们提出了一种生成对抗模型,将噪声反馈转换为对话中合理的自然响应。生成器的目标是将反馈转换为回答用户先前话语的响应,并欺骗区分反馈与自然响应的判别器。我们表明,用这些修改后的反馈响应扩充原始训练数据,在 Personachat 数据集上将原始聊天机器人在正确响应排序上的性能从 69.94% 提高到 75.96%,考虑到原始模型已在 131k 样本上训练,这是一个很大的改进。

关键词

引用

@article{arxiv.2010.07261,
  title  = {Learning Improvised Chatbots from Adversarial Modifications of Natural Language Feedback},
  author = {Makesh Narsimhan Sreedhar and Kun Ni and Siva Reddy},
  journal= {arXiv preprint arXiv:2010.07261},
  year   = {2020}
}

备注

Accepted for publication at Findings of EMNLP 2020