利用离线强化学习构建人格一致的对话智能体
计算与语言
2023-10-18 v1
摘要
保持一致性人格是任何开放域对话系统的关键品质。当前最先进的系统通过监督学习或在线强化学习(RL)训练智能体来实现这一点。然而,经监督学习训练的系统常缺乏一致性,因为它们从未因说出矛盾话语而受惩罚。用 RL 额外训练可缓解部分问题,但训练过程代价高昂。相反,我们提出一种离线 RL 框架以提升对话系统的人格一致性。我们的框架使我们能结合先前方法的优势:可如监督学习般在已有数据上低成本训练模型,同时如 RL 般对特定话语施以惩罚与奖励。我们还引入一种简单的重点采样方法以降低离线 RL 训练中重要性权重的方差,称之为降方差 MLE 初始化(VaRMI)重点采样。我们的自动与人工评估表明,该框架改善了最先进社交聊天机器人的人格一致性与对话质量。
引用
@article{arxiv.2310.10735,
title = {Building Persona Consistent Dialogue Agents with Offline Reinforcement Learning},
author = {Ryan Shea and Zhou Yu},
journal= {arXiv preprint arXiv:2310.10735},
year = {2023}
}
备注
EMNLP 2023