中文

先做后评判:自参考作为提升LLM评估的路径

计算与语言 2025-09-25 v1 人工智能

摘要

LLM-as-Judge框架在AI评估中日益流行,但关于模型生成能力与评判能力之间关系的研究发现仍不一致。我们通过跨11个模型和21个多样化任务的系统性数据集及实例级分析来研究这种关系。尽管两种能力都依赖于相同的底层知识,但我们的分析表明它们仅弱相关,主要源于LLM对被评判响应的敏感性。为解决这一问题,我们提出了一种自参考引导的评估策略,利用模型自身的答案作为参考。该方法显著增强了生成能力与评判能力之间的相关性,为对齐这些技能提供了实用路径,并为评估任务中的模型选择提供了可靠的代理指标。

关键词

引用

@article{arxiv.2509.19880,
  title  = {Do Before You Judge: Self-Reference as a Pathway to Better LLM Evaluation},
  author = {Wei-Hsiang Lin and Sheng-Lun Wei and Hen-Hsen Huang and Hsin-Hsi Chen},
  journal= {arXiv preprint arXiv:2509.19880},
  year   = {2025}
}

备注

Accepted as a long findings paper at EMNLP 2025