中文

UQ:评估语言模型在未解决问题上的表现

计算与语言 2025-08-26 v1 人工智能 机器学习

摘要

基准测试塑造着人工智能研究的进展。实用的基准测试应既困难又真实:问题应挑战前沿模型,同时也反映真实世界的使用。然而,当前范式面临困难与真实性之间的紧张关系:考试式基准测试常被人为制造难度,具有有限的真实世界价值;而基于真实用户交互的基准测试常偏向容易且高频的问题。在本工作中,我们探索了一种根本不同的范式:在未解决的问题上评估模型。不同于一次性评分的静态基准测试,我们精选未解决的问题,并随时间对模型进行异步评估,采用验证者辅助筛选和社区验证。我们介绍 UQ,一个包含 500 个具有挑战性和多样性问题的测试平台, sourced from Stack Exchange,涵盖计算机科学理论、数学、科幻和历史等主题,探索推理、事实性和浏览等能力。UQ 通过构建方式既困难又真实:未解决的问题往往难度大且自然地出现在人类寻求答案时,因此解决它们可直接产生实际价值。我们的贡献有三方面:(1)UQ 数据集及其收集管道结合规则过滤、LLM 评判和人工审阅,确保问题质量(如明确且具挑战性);(2)UQ 验证者,利用生成-验证者之间的差距提供评估信号并预筛候选解答供人工审阅;(3)UQ 平台,一个供专家共同验证问题和解答的开放平台。最佳模型仅在 15%的问题上通过 UQ 验证,初步的人工验证已经在通过验证的解答中识别出正确答案。UQ 为在真实世界、开放性挑战上评估前沿模型指明了道路,其中成功不仅推动了人类知识的前沿发展。我们在 https://uq.stanford.edu 发布 UQ。

关键词

引用

@article{arxiv.2508.17580,
  title  = {UQ: Assessing Language Models on Unsolved Questions},
  author = {Fan Nie and Ken Ziyu Liu and Zihao Wang and Rui Sun and Wei Liu and Weijia Shi and Huaxiu Yao and Linjun Zhang and Andrew Y. Ng and James Zou and Sanmi Koyejo and Yejin Choi and Percy Liang and Niklas Muennighoff},
  journal= {arXiv preprint arXiv:2508.17580},
  year   = {2025}
}

备注

FN, KZL, and NM are project co-leads and contributed equally. Project website: https://uq.stanford.edu