超越 LLM 评判器:面向多语言生成文本评估的确定性指标
计算与语言
2026-04-08 v1 人工智能
机器学习
摘要
虽然大语言模型(LLM)越来越被用作评估生成文本的自动评判器,但其输出往往成本高昂且高度依赖于提示设计、语言和聚合策略,严重限制了可重复性。为此,我们提出了 \textbf{\textit{OmniScore}},一套使用小型(1B)参数模型开发的互补的、确定性的学习型指标。OmniScore 逼近 LLM 评判器行为,同时保持传统基于模型的评分的低延迟和一致性。我们使用大规模人工合成监督(约56.4万实例,107 种语言)进行训练,并在8617个人工标注实例上进行评估。OmniScore 系列支持可靠的、多维度的评分,适用于各种设置,包括参考基准、源 grounding 和混合评估。我们在问答(QA)、翻译和摘要中评估了这些模型,覆盖6种语言。我们的结果表明,轻量级、确定性的学习型指标为对前沿 LLM 提供了高度实用且可扩展的替代方案。我们的模型和数据集可在 https://huggingface.co/collections/QCRI/omniscore 找到。
引用
@article{arxiv.2604.05083,
title = {Beyond LLM-as-a-Judge: Deterministic Metrics for Multilingual Generative Text Evaluation},
author = {Firoj Alam and Gagan Bhatia and Sahinur Rahman Laskar and Shammur Absar Chowdhury},
journal= {arXiv preprint arXiv:2604.05083},
year = {2026}
}