中文

*-PLUIE:面向提升评估的可个人化指标

计算与语言 2026-02-18 v1

摘要

评估自动生成文本质量通常依赖于LLM-as-a-judge(LLM-judge)方法。虽然这些方法有效,但计算成本高昂且需要后处理。为此,我们在ParaPLUIE基础上进行构建——这是一种基于perplexity的LLM-judge指标,用于估计对“是/否”答案的置信度,而无需生成文本。我们引入*-PLUIE,这是ParaPLUIE的任务特定提示变体,并评估其与人类判断的一致性。我们的实验表明,个人化的*-PLUIE在保持低计算成本的同时,实现了更强的与人类评分的相关性。

关键词

引用

@article{arxiv.2602.15778,
  title  = {*-PLUIE: Personalisable metric with Llm Used for Improved Evaluation},
  author = {Quentin Lemesle and Léane Jourdan and Daisy Munson and Pierre Alain and Jonathan Chevelu and Arnaud Delhay and Damien Lolive},
  journal= {arXiv preprint arXiv:2602.15778},
  year   = {2026}
}

备注

Under review