Shepherd:一种用于语言模型生成的评论模型
计算与语言
2023-08-10 v1 人工智能
摘要
随着大语言模型的改进,利用这些模型能力来精炼其自身输出的技术日益受到关注。在这项工作中,我们引入 Shepherd,一种经过专门调优以批评回复并提出改进建议的语言模型,其能力超越未调优模型,可识别多样错误并提供补救建议。我们方法的核心是一个高质量反馈数据集,我们从社区反馈和人工标注中精心整理而得。尽管 Shepherd 规模较小(7B 参数),其批评与包括 ChatGPT 在内的成熟模型相比等效或更受青睐。使用 GPT-4 进行评估,Shepherd 相比竞争替代方案的平均胜率达 53-87%。在人工评估中,Shepherd 严格优于其他模型,且平均与 ChatGPT 几乎持平。
引用
@article{arxiv.2308.04592,
title = {Shepherd: A Critic for Language Model Generation},
author = {Tianlu Wang and Ping Yu and Xiaoqing Ellen Tan and Sean O'Brien and Ramakanth Pasunuru and Jane Dwivedi-Yu and Olga Golovneva and Luke Zettlemoyer and Maryam Fazel-Zarandi and Asli Celikyilmaz},
journal= {arXiv preprint arXiv:2308.04592},
year = {2023}
}
备注
7 figures, 7 tables