中文

SCRuB:基于评估标准的社会概念推理框架

人工智能 2026-05-08 v1

摘要

虽许多关于大语言模型(LLM)推理能力的研究聚焦于数学或技术任务,但对社会概念推理——即塑造社会规范、文化与制度的抽象思想的研究却鲜有涉及。这种尚未充分研发的能力对作为社会代理的现代模型至关重要,却缺乏系统性评估方法。我们引入SCRuB(Social Concept Reasoning under Rubric-Based Evaluation),一个针对该任务不确定性情境设计的评估框架。其目标是衡量模型在社会概念推理方面是否具备人类专家所具有的深度与批判性严谨性。SCRuB包含三个阶段:从已有资源构建提示、由专家与模型生成响应、使用五维批判性思维评估标准进行比较评估。为提升管道的可推广性,我们引入了由多元学 discipline视角组成的Panel,以独立专家评判标准验证。我们发布SCRuBEval(4711个评估提示)与SCRuBAnnotations(300个专家撰写的响应及150个由45名博士级学者完成的专家比较判断)。结果显示,前沿模型在所有五个评估维度上均超越人类专家。在1170对两两比较中,专家评判将模型响应排名第一的比例达80.8%,总体上更倾向于模型响应74.4%。最终,本研究首次在社会概念推理方面实现了评估饱和:单轮考试式格式已对模型与人类而言达到瓶颈。

关键词

引用

@article{arxiv.2605.06444,
  title  = {SCRuB: Social Concept Reasoning under Rubric-Based Evaluation},
  author = {Jamelle Watson-Daniels and Himaghna Bhattacharjee and Skyler Wang and Brandon Handoko and Antonio Li and Anaelia Ovalle and Mahesh Pasupuleti and Candace Ross and Vidya Sarma and Arjun Subramonian and Karen Ullrich and Will van der Vaart and Yijing Xin and Maximilian Nickel},
  journal= {arXiv preprint arXiv:2605.06444},
  year   = {2026}
}