中文

Check-Eval:一种基于清单的文本质量评估方法

计算与语言 2024-09-11 v2 人工智能

摘要

评估大型语言模型(LLMs)生成的文本质量仍然是一个重大挑战。传统指标通常无法与人类判断很好地一致,尤其是在需要创造力和细微差别的任务中。在本文中,我们提出了Check-Eval,这是一个新颖的评估框架,它利用LLMs通过基于清单的方法来评估生成文本的质量。Check-Eval既可以用作无参考评估方法,也可以用作依赖参考的评估方法,为文本质量提供结构化和可解释的评估。该框架包含两个主要阶段:清单生成和清单评估。我们在两个基准数据集上验证了Check-Eval:葡萄牙语法律语义文本相似度和SummEval。我们的结果表明,与现有指标(如G-Eval和GPTScore)相比,Check-Eval与人类评分实现了更高的相关性,突显了其作为自然语言生成任务更可靠、更有效评估框架的潜力。我们的实验代码可在https://anonymous.4open.science/r/check-eval-0DB4获取。

关键词

引用

@article{arxiv.2407.14467,
  title  = {Check-Eval: A Checklist-based Approach for Evaluating Text Quality},
  author = {Jayr Pereira and Andre Assumpcao and Roberto Lotufo},
  journal= {arXiv preprint arXiv:2407.14467},
  year   = {2024}
}