中文

GPQA:一个研究生水平的防搜索问答基准

人工智能 2023-11-21 v1 计算与语言

摘要

我们提出 GPQA,一个由生物学、物理学和化学领域专家撰写的 448 道选择题构成的极具挑战性数据集。我们确保问题高质量且极难:对应领域已获或正在攻读 PhD 的专家准确率为 65%(若剔除专家事后确认的明显错误则为 74%),而高技能非专家验证者尽管平均花费超 30 分钟并无限制访问网络(即问题“防 Google”),准确率仅 34%。问题对最先进 AI 系统亦困难,我们最强的基于 GPT-4 的基线达 39% 准确率。若未来要用 AI 系统协助回答极难问题(例如开发新科学知识时),需开发可扩展监督方法使人类能监督其输出,即便监督者本身熟练且博学,此亦可能困难。GPQA 对熟练非专家与前沿 AI 系统的双重困难应能促进 realistic 可扩展监督实验,我们希望其有助于设计使人类专家可靠从超越人类能力的 AI 系统获取真实信息的方法。

关键词

引用

@article{arxiv.2311.12022,
  title  = {GPQA: A Graduate-Level Google-Proof Q&A Benchmark},
  author = {David Rein and Betty Li Hou and Asa Cooper Stickland and Jackson Petty and Richard Yuanzhe Pang and Julien Dirani and Julian Michael and Samuel R. Bowman},
  journal= {arXiv preprint arXiv:2311.12022},
  year   = {2023}
}

备注

28 pages, 5 figures, 7 tables