中文

合成评估丢失了什么?

计算与语言 2025-10-07 v3 人工智能

摘要

大型语言模型(LLMs)正日益被用于数据生成。然而,创建评估基准对这一新兴范式提出了更高要求。基准必须针对特定现象、惩罚对捷径的利用且具备挑战性。通过两个案例研究,我们考察了 LLMs 能否满足这些要求,具体做法是生成推理型文本基准,并将其与通过精心众包创建的基准进行比较。具体而言,我们评估了两个高质量阅读理解数据集的 LLM 生成版本的有效性与难度:CondaQA(评估关于否定的推理)和 DROP(针对关于数量的推理)。我们发现,提示 LLMs 可以生成这些数据集的变体,这些变体根据标注指南通常是有效的,而成本仅为原始众包工作的一小部分。然而,我们表明,与人类编写的对应版本相比,它们对 LLMs 的挑战性较低。这一发现揭示了使用 LLMs 生成评估数据可能丢失了什么,并呼吁批判性地重新评估这种日益普遍的基准创建方法的即时使用。

关键词

引用

@article{arxiv.2505.22830,
  title  = {What Has Been Lost with Synthetic Evaluation?},
  author = {Alexander Gill and Abhilasha Ravichander and Ana Marasović},
  journal= {arXiv preprint arXiv:2505.22830},
  year   = {2025}
}

备注

v3: Camera Ready