CORAL:用于训练对话生成模型的上下文响应可检索性损失函数
计算与语言
2023-05-23 v3
摘要
在自然语言处理领域,许多任务可使用交叉熵(CE)损失函数有效解决。然而,对话生成任务对CE损失提出了独特挑战。这是因为CE损失假设对于任意给定输入,唯一可能的输出是训练数据集中作为真实标签可用的那个。但在对话生成中,可能存在多个有效响应(针对给定上下文),它们不仅表面形式不同,语义也可能不同。此外,对话生成任务的CE损失计算不考虑输入上下文,因此它对响应的评分与上下文无关。为了对生成响应的相关性、吸引力等质量进行评分,损失函数应同时依赖于上下文和生成的响应。为解决这些局限,本文提出CORAL,一种基于强化学习(RL)视角看待对话生成任务的新颖损失函数,其奖励函数在考虑上下文和响应的同时估计人类对生成响应的偏好。此外,为克服RL训练高样本复杂度和大动作空间等挑战,我们提出一种混合策略训练算法。值得注意的是,使用CORAL我们可以在不必将真实标签视为唯一正确响应的情况下训练对话生成模型。在基准数据集上的大量对比表明,基于CORAL的模型优于不同规模的强SOTA基线模型。
引用
@article{arxiv.2205.10558,
title = {CORAL: Contextual Response Retrievability Loss Function for Training Dialog Generation Models},
author = {Bishal Santra and Ravi Ghadia and Manish Gupta and Pawan Goyal},
journal= {arXiv preprint arXiv:2205.10558},
year = {2023}
}
备注
15 pages, 3 figures. TLDR: CORAL proposes a novel loss function for dialog generation, incorporating context and multiple valid responses. It outperforms existing models by optimizing human preference through reinforcement learning