LLM生成文本的统计多准则评估
计算与语言
2025-06-25 v2 应用统计
摘要
评估LLM生成文本的质量仍是自然语言处理中的基本挑战。当前评估方法常依赖单一指标或简单聚合,无法捕捉连贯性、多样性、流畅性等相关指标之间的细致权衡。本文采用基于广义随机支配(GSD)的统计推断框架,以解决现有基准测试方法的三个关键局限:单指标评估的不足、基数自动评估指标与序数人类判断之间的不兼容性,以及缺乏推断统计保障。GSD方法能够在尊重不同测量尺度的前提下,同时跨多个质量维度进行评估,构建于解码策略的部分序关系之上,从而避免对相关指标进行任意加权。通过将常用解码策略对比于人工生成文本,展示了该框架在识别统计显著性能差异方面的能力,同时考虑了抽样设计中可能偏离独立同分布假设的情形。
引用
@article{arxiv.2506.18082,
title = {Statistical Multicriteria Evaluation of LLM-Generated Text},
author = {Esteban Garces Arias and Hannah Blocher and Julian Rodemann and Matthias Aßenmacher and Christoph Jansen},
journal= {arXiv preprint arXiv:2506.18082},
year = {2025}
}