MILE-RefHumEval:基于多独立LLM框架的无参考人类对齐评估
计算与语言
2026-02-11 v1
摘要
我们介绍MILE-RefHumEval,一个无需 ground-truth 标注或评估者协调的LLM评估框架。它利用独立提示的评估者集合,这些评估者受人类对齐模式指导,支持离散和连续评分判断。通过来自最佳候选选择、摘要和图像描述到对话的任务特定提示,MILE-RefHumEval 提供灵活、可解释且可扩展的评估。实验表明,它与人类判断高度一致,超越先前方法,显著减少计算开销,为实际LLM评估提供一种高效、稳健且人类对齐的解决方案。
引用
@article{arxiv.2602.09624,
title = {MILE-RefHumEval: A Reference-Free, Multi-Independent LLM Framework for Human-Aligned Evaluation},
author = {Nalin Srun and Parisa Rastin and Guénaël Cabanes and Lydia Boudjeloud Assala},
journal= {arXiv preprint arXiv:2602.09624},
year = {2026}
}