面向长文本问答的公理化偏好建模
人工智能
2023-12-06 v1 计算与语言
摘要
GPT-4 等大型语言模型 (LLM) 的卓越能力部分源于训练后过程,如基于人类反馈的强化学习 (RLHF),其中涉及编码在奖励模型中的人类偏好。然而,这些奖励模型 (RM) 通常缺乏关于为何或基于何种原则做出偏好标注的直接知识。在本研究中,我们确定了指导 RM 更好地与人类偏好对齐的原则,随后开发了一个公理化框架以生成丰富多样的偏好信号来维护这些原则。我们使用这些公理化信号来训练一个对长文本问题的答案进行评分的模型。我们的方法产生了一个仅约 220M 参数的偏好模型,其与人类标注的黄金偏好标签的一致性高于 GPT-4。本工作的贡献包括:训练一个独立的偏好模型,能够以同一尺度对人类和 LLM 生成的答案进行评分;开发一个公理化框架,用于生成针对特定原则定制的训练数据对;以及证明少量的公理化信号可以帮助小模型在偏好评分上超越 GPT-4。我们在 huggingface 上发布了我们的模型:https://huggingface.co/corbyrosset/axiomatic_preference_model
引用
@article{arxiv.2312.02206,
title = {Axiomatic Preference Modeling for Longform Question Answering},
author = {Corby Rosset and Guoqing Zheng and Victor Dibia and Ahmed Awadallah and Paul Bennett},
journal= {arXiv preprint arXiv:2312.02206},
year = {2023}
}
备注
Accepted to EMNLP 2023