借助人类反馈提升开放域聊天机器人性能
计算与语言
2022-08-31 v1
摘要
许多基于社交媒体评论预训练的开放域对话模型能生成连贯回复,但在与真实用户交互时难以产生引人入胜的回应。该现象主要源于标注人-人对话的匮乏以及与人类偏好的错位。本文提出一种新颖高效的 Diamante 方法来提升开放域聊天机器人,其中收集并利用了两类人类反馈(包括显式示范与隐式偏好)。通过让标注者选择或修改模型生成的候选回复,Diamante 高效收集了人类示范回复并构建了一个中文闲聊数据集。为增强与人类偏好的对齐,Diamante 利用数据收集过程中的隐式偏好并引入生成-评估联合训练。综合实验表明,Diamante 数据集与联合训练范式能显著提升中文预训练对话模型的性能。
引用
@article{arxiv.2208.14165,
title = {Towards Boosting the Open-Domain Chatbot with Human Feedback},
author = {Hua Lu and Siqi Bao and Huang He and Fan Wang and Hua Wu and Haifeng Wang},
journal= {arXiv preprint arXiv:2208.14165},
year = {2022}
}
备注
First two authors contributed equally to this work