合成评估丢失了什么?
计算与语言
2025-10-07 v3 人工智能
摘要
大型语言模型(LLMs)正日益被用于数据生成。然而,创建评估基准对这一新兴范式提出了更高要求。基准必须针对特定现象、惩罚对捷径的利用且具备挑战性。通过两个案例研究,我们考察了 LLMs 能否满足这些要求,具体做法是生成推理型文本基准,并将其与通过精心众包创建的基准进行比较。具体而言,我们评估了两个高质量阅读理解数据集的 LLM 生成版本的有效性与难度:CondaQA(评估关于否定的推理)和 DROP(针对关于数量的推理)。我们发现,提示 LLMs 可以生成这些数据集的变体,这些变体根据标注指南通常是有效的,而成本仅为原始众包工作的一小部分。然而,我们表明,与人类编写的对应版本相比,它们对 LLMs 的挑战性较低。这一发现揭示了使用 LLMs 生成评估数据可能丢失了什么,并呼吁批判性地重新评估这种日益普遍的基准创建方法的即时使用。
引用
@article{arxiv.2505.22830,
title = {What Has Been Lost with Synthetic Evaluation?},
author = {Alexander Gill and Abhilasha Ravichander and Ana Marasović},
journal= {arXiv preprint arXiv:2505.22830},
year = {2025}
}
备注
v3: Camera Ready