GPTScore:按你所愿进行评估
计算与语言
2023-02-14 v2
摘要
生成式人工智能(AI)使得利用大型预训练模型开发能够产出高质量文本、图像及其他输出的复杂模型成为可能。然而,评估生成内容的质量甚至比生成本身更为艰巨,且此问题近来未得到充分重视。本文提出一种新颖的评估框架GPTScore,其利用生成式预训练模型的涌现能力(如零样本指令)对生成文本打分。本文探究了19种预训练模型,规模从80M(如FLAN-T5-small)到175B(如GPT3)不等。在四个文本生成任务、22个评估维度及相应37个数据集上的实验结果表明,该方法能有效让我们仅通过自然语言指令即可实现对文本所欲评估之内容。这一特性帮助我们克服了文本评估中若干长期存在的挑战——如何在不需标注样本的情况下实现定制化、多维度的评估。我们的代码已公开于https://github.com/jinlanfu/GPTScore。
引用
@article{arxiv.2302.04166,
title = {GPTScore: Evaluate as You Desire},
author = {Jinlan Fu and See-Kiong Ng and Zhengbao Jiang and Pengfei Liu},
journal= {arXiv preprint arXiv:2302.04166},
year = {2023}
}