中文

LLM生成文本的统计多准则评估

计算与语言 2025-06-25 v2 应用统计

摘要

评估LLM生成文本的质量仍是自然语言处理中的基本挑战。当前评估方法常依赖单一指标或简单聚合,无法捕捉连贯性、多样性、流畅性等相关指标之间的细致权衡。本文采用基于广义随机支配(GSD)的统计推断框架,以解决现有基准测试方法的三个关键局限:单指标评估的不足、基数自动评估指标与序数人类判断之间的不兼容性,以及缺乏推断统计保障。GSD方法能够在尊重不同测量尺度的前提下,同时跨多个质量维度进行评估,构建于解码策略的部分序关系之上,从而避免对相关指标进行任意加权。通过将常用解码策略对比于人工生成文本,展示了该框架在识别统计显著性能差异方面的能力,同时考虑了抽样设计中可能偏离独立同分布假设的情形。

关键词

引用

@article{arxiv.2506.18082,
  title  = {Statistical Multicriteria Evaluation of LLM-Generated Text},
  author = {Esteban Garces Arias and Hannah Blocher and Julian Rodemann and Matthias Aßenmacher and Christoph Jansen},
  journal= {arXiv preprint arXiv:2506.18082},
  year   = {2025}
}