中文

估计大型语言模型在两两文本比较中的误差

计算与语言 2025-10-28 v1 人工智能 概率论

摘要

我们衡量大型语言模型(LLM)在两两文本比较任务中的输出误差,关注其偏好决策的错误概率。我们的方法不依赖于真实标签,支持两种情形:(i)假设误差率与比较顺序无关,通过对每对文本进行两种比较(任选一种文本置于首位)来估计;(ii)假设存在二元位置偏差,即两种比较顺序的误差率不同,通过对同一文本之间的重复比较来估计。Copeland 计数法从两两偏好中构建排序;该排序揭示了基于 LLM 的两两比较的差异扩大问题,并帮助推算 LLM 误差率的估计值。我们将该方法应用于六个 LLM(ChatGPT、Claude、DeepSeek、Gemini、Grok、Qwen),并针对五类文本输入类型获得了一致的 LLM 误差估计。总体而言,测量的两种位置偏差项相似,接近于均匀误差。考虑到误差率和提示词变化的鲁棒性,Claude 在本实验中表现最佳。我们的模型优于偏倚的 Bradley-Terry 模型和 commutativity 评分,更能指示 LLM 在此任务中的误差。

关键词

引用

@article{arxiv.2510.22219,
  title  = {Estimating the Error of Large Language Models at Pairwise Text Comparison},
  author = {Tianyi Li},
  journal= {arXiv preprint arXiv:2510.22219},
  year   = {2025}
}

备注

14 pages, 6 figures