中文

我会对你撒谎吗?使用直接偏好头进行语言模型的推理时对齐

计算与语言 2024-05-31 v1 人工智能 机器学习

摘要

预训练语言模型(LM)展现出强大的零样本和上下文学习能力;然而,其行为往往难以控制。通过利用基于人类反馈的强化学习(RLHF),可以对无监督LM进行微调,使其遵循指令并产生反映人类偏好的输出。尽管有这些好处,但RLHF已被证明可能损害语言模型的推理能力,并引入诸如幻觉等伪影,即模型可能编造事实。为了解决这个问题,我们引入了直接偏好头(DPH),这是一种微调框架,通过一个辅助奖励头使LM学习人类偏好信号,而不直接影响语言建模头的输出分布。我们对目标函数进行了理论分析,发现其与保守直接偏好优化(cDPO)有紧密联系。最后,我们在GLUE、RACE和GPT4All评估套件上评估了我们的模型,并证明我们的方法产生的模型比单独使用监督微调(SFT)或直接偏好优化(DPO)微调的模型获得了更高的分数。

关键词

引用

@article{arxiv.2405.20053,
  title  = {Would I Lie To You? Inference Time Alignment of Language Models using Direct Preference Heads},
  author = {Avelina Asada Hadji-Kyriacou and Ognjen Arandjelovic},
  journal= {arXiv preprint arXiv:2405.20053},
  year   = {2024}
}