*-PLUIE:面向提升评估的可个人化指标
计算与语言
2026-02-18 v1
摘要
评估自动生成文本质量通常依赖于LLM-as-a-judge(LLM-judge)方法。虽然这些方法有效,但计算成本高昂且需要后处理。为此,我们在ParaPLUIE基础上进行构建——这是一种基于perplexity的LLM-judge指标,用于估计对“是/否”答案的置信度,而无需生成文本。我们引入*-PLUIE,这是ParaPLUIE的任务特定提示变体,并评估其与人类判断的一致性。我们的实验表明,个人化的*-PLUIE在保持低计算成本的同时,实现了更强的与人类评分的相关性。
引用
@article{arxiv.2602.15778,
title = {*-PLUIE: Personalisable metric with Llm Used for Improved Evaluation},
author = {Quentin Lemesle and Léane Jourdan and Daisy Munson and Pierre Alain and Jonathan Chevelu and Arnaud Delhay and Damien Lolive},
journal= {arXiv preprint arXiv:2602.15778},
year = {2026}
}
备注
Under review