LLM 作为元评判家:用于 NLP 评估指标验证的合成数据
计算与语言
2026-03-11 v1
摘要
验证 NLG 的 evaluation metrics 通常依赖于昂贵且耗时的 human annotations,这些 annotations 主要只存在于 English 数据集中。我们提出 "LLM 作为元评判家",一个 scalable 框架,利用 LLMs 生成通过受控语义退化的 real data 的 synthetic evaluation 数据集,以取代 human judgment。我们使用 meta-correlation 来验证我们的方法,这是衡量 metric rankings 从 synthetic data 与来自 standard human benchmarks 之间的 alignment 的指标。Machine Translation、Question Answering 和 Summarization 领域的实验表明,synthetic validation 作为 human judgment 的可靠代理,实现了 multilingual QA 中的 meta-correlations 超过 0.9,证明其在 human judgments 不可用或获取成本过高的地方是可行的替代方案。我们的 code 和 data 将在论文接受后公开。
引用
@article{arxiv.2603.09403,
title = {LLM as a Meta-Judge: Synthetic Data for NLP Evaluation Metric Validation},
author = {Lukáš Eigler and Jindřich Libovický and David Hurych},
journal= {arXiv preprint arXiv:2603.09403},
year = {2026}
}
备注
16 pages, 1 figure, 14 tables