自教评估器
计算与语言
2024-08-09 v2 人工智能
摘要
基于模型的评估是成功模型开发的核心——作为训练的奖励模型,以及作为人类评估的替代方案。为了训练此类评估器,标准方法是收集大量人类偏好判断数据,这既昂贵又随着模型改进而数据过时。在本工作中,我们提出了一种旨在无需人类标注即可改进评估器的方法,仅使用合成训练数据。从无标签指令出发,我们的迭代自改进方案生成对比性的模型输出,并训练一个LLM-as-a-Judge来生成推理轨迹和最终判断,在每个新迭代中使用改进的预测重复该训练过程。没有任何标注偏好数据的情况下,我们的自教评估器可以将一个强LLM(Llama3-70B-Instruct)在RewardBench上的表现从75.4提升至88.3(经多数投票后为88.7)。这优于常用的LLM评估器如GPT-4,并达到了使用标注样本训练的最优奖励模型的性能水平。
引用
@article{arxiv.2408.02666,
title = {Self-Taught Evaluators},
author = {Tianlu Wang and Ilia Kulikov and Olga Golovneva and Ping Yu and Weizhe Yuan and Jane Dwivedi-Yu and Richard Yuanzhe Pang and Maryam Fazel-Zarandi and Jason Weston and Xian Li},
journal= {arXiv preprint arXiv:2408.02666},
year = {2024}
}