中文

通过耦合标记生成评估大型语言模型

计算与语言 2026-03-26 v3 人工智能 机器学习

摘要

最新大型语言模型依赖于随机性来响应提示。因此,模型可能因多次询问相同提示而作出不同响应。在本文中,我们认为大型语言模型的评估与排序应控制其功能所依赖的随机性。我们的起点是开发用于耦合自回归生成的因果模型,允许不同大型语言模型使用相同的随机源进行采样。基于我们的因果模型,我们首先表明,在基于基准数据集的评估中,耦合自回归生成与纯粹的自回归生成得出相同结论,但使用 provably 更少的样本。然而,我们进一步表明,在基于(人类)成对比较的评估中,耦合和纯粹的自回归生成即使在无限样本数下也可能导致不同排序,这当比较超过两种模型时尤其如此。这表明现有评估协议中模型相对于其他模型的 apparent 优势可能并非真实存在,而是源于生成过程固有的随机性。为说明和补充我们的理论结果,我们针对Llama、Mistral和Qwen系列的几个大型语言模型进行实验。我们发现,在多个基准数据集上,耦合自回归生成需要的最少样本数可减少最高75%以达到与纯粹自回归生成相同的结论。进一步地,我们发现来自LMSYS Chatbot Arena平台的提示由强大大型语言模型派生的胜率,在耦合和纯粹自回归生成下存在差异。

关键词

引用

@article{arxiv.2502.01754,
  title  = {Evaluation of Large Language Models via Coupled Token Generation},
  author = {Nina Corvelo Benz and Stratis Tsirtsis and Eleni Straitouri and Ivi Chatzi and Ander Artola Velasco and Suhas Thejaswi and Manuel Gomez-Rodriguez},
  journal= {arXiv preprint arXiv:2502.01754},
  year   = {2026}
}