探索大语言模型在无参考文本质量评估中的使用:一项实证研究
计算与语言
2023-09-19 v3
摘要
评估生成文本的质量是自然语言处理中的一项挑战性任务,原因在于文本固有的复杂性与多样性。近来,大语言模型(LLMs)因其在各类任务中的出色表现而备受关注。因此,我们提交本文以探究 LLMs(尤其是 ChatGPT)的有效性,并探索优化其在文本质量评估中使用的途径。我们比较了三类无参考评估方法。实验结果证明,ChatGPT 无需参考即可从多视角有效评估文本质量,且表现出优于大多数现有自动指标的性能。特别地,利用 ChatGPT 生成衡量文本质量的数值评分的显式评分(Explicit Score)是三种所采用方法中最有效且可靠的。然而,直接比较两篇文本的质量可能导致次优结果。我们相信本文将为利用 LLMs 评估文本质量提供有价值的见解,并已发布所用数据。
引用
@article{arxiv.2304.00723,
title = {Exploring the Use of Large Language Models for Reference-Free Text Quality Evaluation: An Empirical Study},
author = {Yi Chen and Rui Wang and Haiyun Jiang and Shuming Shi and Ruifeng Xu},
journal= {arXiv preprint arXiv:2304.00723},
year = {2023}
}