中文

重新思考 LLM-as-a-Judge:基于语义容量不对称的小型语言模型表示即判官

计算与语言 2026-02-02 v1 人工智能 机器学习

摘要

大型语言模型(LLMs)广泛用作无参考的评估器,通过提示实现,但这种“LLM-as-a-Judge”范式成本高昂、难以解释且对提示设计敏感。在本工作中,我们调查小型模型是否可通过利用内部表示而非表面生成来作为高效评估器。我们发现,尽管小型语言模型在生成能力方面较弱,但其隐藏状态中编码了丰富的评估信号。这激励我们提出语义容量不对称假设(Semantic Capacity Asymmetry Hypothesis):评估所需的语义容量显著低于生成能力,可在中间表示中实现,从而表明评估不必依赖大规模生成模型,而可从较小模型的潜在特征中获得。这一发现促成了从 LLM-as-a-Judge 向 Representation-as-a-Judge 的范式转变,一种通过探测内部模型结构而非依赖提示输出的解码自由评估策略。我们通过 INSPECTOR 实现了这一范式,这是一个基于探测的框架,从小型模型表示中预测细粒度评估得分。在推理基准(GSM8K、MATH、GPQA)上的实验表明,INSPECTOR 在对抗小型模型的提示方法方面显著优于它们,几乎逼近完整的 LLM 评估器,同时提供了更高效、更可靠、更可解释的可扩展评估方案。

关键词

引用

@article{arxiv.2601.22588,
  title  = {Rethinking LLM-as-a-Judge: Representation-as-a-Judge with Small Language Models via Semantic Capacity Asymmetry},
  author = {Zhuochun Li and Yong Zhang and Ming Li and Yuelyu Ji and Yiming Zeng and Ning Cheng and Yun Zhu and Yanmeng Wang and Shaojun Wang and Jing Xiao and Daqing He},
  journal= {arXiv preprint arXiv:2601.22588},
  year   = {2026}
}