中文

基于分布性假设的无评判 LLM 开放式生成基准

计算与语言 2025-02-14 v1

摘要

评估大型语言模型 (LLM) 的开放式文本生成具有挑战性, 由于缺乏明确的基准答案以及人类或 LLM 评估的高成本. 我们提出一种新颖的基准, 该基准不依赖人类判断或 LLM 评判方法, 而是使用 n gram 统计数据和规则进行评估. 通过 50 组问题与参考答案, 我们引入三项新指标:流畅性、真实性和有用性. 我们的基准与基于 GPT-4o 的评估高度相关, 同时所需计算资源显著降低, 证明其作为评估 LLM 开放式生成能力的高效替代方案具有有效性.

关键词

引用

@article{arxiv.2502.09316,
  title  = {A Judge-free LLM Open-ended Generation Benchmark Based on the Distributional Hypothesis},
  author = {Kentaro Imajo and Masanori Hirano and Shuji Suzuki and Hiroaki Mikami},
  journal= {arXiv preprint arXiv:2502.09316},
  year   = {2025}
}

备注

13 pages