ZYN:用于RLAIF的基于是非问句的零样本奖励模型
计算与语言
2023-12-15 v2 人工智能
摘要
本工作中,我们解决将语言模型(LM)的文本生成导向期望行为、使生成文本与人类操作者的偏好对齐的问题。我们提出以零样本方式使用另一个指令微调语言模型作为评判奖励模型,借助代表用户偏好的是非(Yes-No)问句提示,无需额外标注数据。该零样本奖励模型提供学习信号,以利用基于 AI 反馈的强化学习(RLAIF)进一步微调基础 LM;然而我们的方法在其他情境下亦兼容,例如质量-多样性搜索。通过在文本生成相关不同领域的实验提供了所提 ZYN 框架能力的广泛证据,包括解毒;优化影评情感或任何其他属性;引导模型对特定话题可能持有的观点;以及为文生图任务个性化提示生成器。代码见 \url{https://github.com/vicgalle/zero-shot-reward-models/}。
引用
@article{arxiv.2308.06385,
title = {ZYN: Zero-Shot Reward Models with Yes-No Questions for RLAIF},
author = {Victor Gallego},
journal= {arXiv preprint arXiv:2308.06385},
year = {2023}
}
备注
pre-print, work in progress