OpeNLGauge:面向开放权重大语言模型的自然语言生成评估可解释指标
计算与语言
2025-11-19 v3
摘要
大语言模型(LLM)作为自然语言生成(NLG)系统的评估器展现出巨大潜力,可实现高质量、无参考、多维度的评估。然而,现有的基于LLM的评估指标存在两个主要缺点:依赖专有模型生成训练数据或执行评估,以及缺乏细粒度的解释性反馈。本研究提出OpeNLGauge,一个完全开源、无参考的NLG评估指标,基于错误片段提供准确的解释。OpeNLGauge可作为更大规模开放权重LLM的两阶段集成模型,也可作为小型微调评估模型,并已确认可泛化至未见过的任务、领域和维度。广泛的元评估表明,OpeNLGauge在多项任务上达到了与人类判断的竞争力相关性,在某些任务上超越了最先进模型,同时保持完全可复现性,并提供了两倍以上更准确的解释。
引用
@article{arxiv.2503.11858,
title = {OpeNLGauge: An Explainable Metric for NLG Evaluation with Open-Weights LLMs},
author = {Ivan Kartáč and Mateusz Lango and Ondřej Dušek},
journal= {arXiv preprint arXiv:2503.11858},
year = {2025}
}
备注
INLG 2025