利用大规模人类反馈数据训练对话响应排序
计算与语言
2020-09-16 v1
摘要
现有的开放域对话模型通常训练以最小化目标人类响应的困惑度。然而,某些人类回复比其他的更具吸引力,会引发更多的后续交互。当前的对话模型越来越能够生成与上下文相关的轮次,但为了产生引人入胜的智能体,这些模型需要能够预测并优化真正吸引人的轮次。我们利用社交媒体反馈数据(回复数与点赞数)构建用于反馈预测的大规模训练数据集。为缓解反馈与吸引力之间可能的偏差,我们将排序问题转化为涉及较少混杂因素的响应对比较。我们在 1.33 亿对人类反馈数据上训练了基于 GPT-2 的 DialogRPT 模型集合,所得排序器优于多个基线。特别地,我们的排序器在预测 Reddit 反馈上以较大优势超越常规对话困惑度基线。我们最终结合反馈预测模型与类人评分模型来对机器生成的对话响应排序。众包人工评估显示,我们的排序方法比基线模型与实际人类偏好相关性更好。
引用
@article{arxiv.2009.06978,
title = {Dialogue Response Ranking Training with Large-Scale Human Feedback Data},
author = {Xiang Gao and Yizhe Zhang and Michel Galley and Chris Brockett and Bill Dolan},
journal= {arXiv preprint arXiv:2009.06978},
year = {2020}
}
备注
Accepted to appear at EMNLP 2020