基于对比强化学习的鲁棒故事生成偏好学习
计算与语言
2022-12-16 v2
摘要
受控自动故事生成旨在生成满足自然语言评论或偏好约束的自然语言故事。现有的控制故事偏好的方法利用提示工程,其劳动密集且常不一致。它们也可能使用 logit 操控方法,这要求所需属性存在标注数据集。为解决这些问题,我们首先训练一个对比双编码器模型以将故事与相应人类评论对齐,称为 CARP,构建通用偏好模型。随后将其用作奖励函数,通过强化学习微调生成语言模型。然而,仅用对比奖励模型微调生成语言模型并不总能可靠地产生能够生成符合用户偏好故事的故事生成系统。为提高故事生成的鲁棒性,我们进一步使用提示学习技术微调对比奖励模型。随后进行了人类参与者研究,比较我们的完整系统、消融版本和两个基线的生成结果。我们表明完整的微调流程产生的故事生成器优于大 20 倍的 LLM 以及基于 logit 的方法。这推动了对比学习在通用人类偏好建模中的使用。
引用
@article{arxiv.2210.07792,
title = {Robust Preference Learning for Storytelling via Contrastive Reinforcement Learning},
author = {Louis Castricato and Alexander Havrilla and Shahbuland Matiana and Michael Pieler and Anbang Ye and Ian Yang and Spencer Frazier and Mark Riedl},
journal= {arXiv preprint arXiv:2210.07792},
year = {2022}
}