中文

你确定吗? 再次排序: 用于更佳偏好数据集的重复排序

计算与语言 2024-06-04 v2 人工智能 机器学习

摘要

使用强化学习从AI反馈(RLAIF)训练的大型语言模型( LLMs)更贴近人类偏好。这涉及到评估模型对用户提示的多个候选响应进行排序。然而,流行的评估模型如GPT-4的排序结果可能不一致。我们提出了重复排序方法-即对相同的响应进行多次评估,仅训练那些 consistently 排序的响应。在62种语言中使用2714个提示,我们让7个顶级多语言LLM生成响应,并让GPT-4对每个响应进行五次排序。在六种语言的MT-Bench聊天基准测试中,我们的方法在使用所有可用提示进行训练的标准做法方面表现更好。我们的工作凸显了RLAIF数据集生成中的质量与数量之间的权衡,并为增强数据集从而提升模型质量提供了可堆叠的策略。

关键词

引用

@article{arxiv.2405.18952,
  title  = {Are You Sure? Rank Them Again: Repeated Ranking For Better Preference Datasets},
  author = {Peter Devine},
  journal= {arXiv preprint arXiv:2405.18952},
  year   = {2024}
}