中文

REPA:用于评估文本生成与评判能力的俄语错误类型标注

计算与语言 2025-06-17 v2

摘要

大型语言模型(LLMs)的最新进展引入了使用 LLM 作为评判者的新范式,即由一个 LLM 评估和打分另一个 LLM 的输出,这通常与人类偏好高度相关。然而,LLM-as-a-judge 的使用主要在英语中得到了研究。在本文中,我们通过引入俄语错误类型标注数据集(REPA)(一个包含 1k 个用户查询和 2k 个 LLM 生成响应的数据集),在俄语中评估了该框架。人类标注者对每个响应对进行标注,表达了他们在十种特定错误类型上的偏好,并选择了总体偏好。我们使用基于人类偏好的三种评分系统,按错误类型对六个生成式 LLM 进行了排名。我们还在零样本和少样本设置下使用八个 LLM 评判者评估了响应。我们描述了分析评判者以及位置和长度偏差的结果。我们的发现揭示了 LLM 评判者在俄语和英语中的表现存在显著差距。然而,基于人类和 LLM 偏好的排名显示出部分一致性,这表明尽管当前的 LLM 评判者在俄语的细粒度评估中存在困难,但仍具有改进的潜力。

关键词

引用

@article{arxiv.2503.13102,
  title  = {REPA: Russian Error Types Annotation for Evaluating Text Generation and Judgment Capabilities},
  author = {Alexander Pugachev and Alena Fenogenova and Vladislav Mikhailov and Ekaterina Artemova},
  journal= {arXiv preprint arXiv:2503.13102},
  year   = {2025}
}

备注

To appear at SIGSLAV 2025