中文

大语言模型短文本事实性评估

计算与语言 2024-11-08 v1

摘要

我们提出了SimpleQA,一个用于评估语言模型回答简短事实性查询能力的基准。在设计该评估时,我们优先考虑了两个特性。第一,SimpleQA具有挑战性,因为它是在针对GPT-4回答的对抗性收集过程中构建的。第二,回答易于评分,因为问题被设计为只存在唯一、无可争议的答案。SimpleQA中的每个答案被评定为正确、不正确或未尝试。理想行为的模型应尽可能多地答对问题,同时不尝试回答其不确定是否知道正确答案的问题。SimpleQA是对模型是否"知道自己知道什么"的简单、有针对性的评估,我们希望该基准在未来几代前沿模型中保持相关性。SimpleQA可在https://github.com/openai/simple-evals获取。

关键词

引用

@article{arxiv.2411.04368,
  title  = {Measuring short-form factuality in large language models},
  author = {Jason Wei and Nguyen Karina and Hyung Won Chung and Yunxin Joy Jiao and Spencer Papay and Amelia Glaese and John Schulman and William Fedus},
  journal= {arXiv preprint arXiv:2411.04368},
  year   = {2024}
}

备注

Blog post: https://openai.com/index/introducing-simpleqa/