中文

AGI的到来?专家人格超越专家基准

计算机与社会 2026-03-24 v1 人工智能

摘要

专家人格是否改善语言模型的性能?Wharton Generative AI Lab报告称否,并通过社交媒体向数百万人宣传建议实践者放弃一种由Anthropic、Google和OpenAI推荐的技术。我们证明,这一空结果在数据收集之前就可被预测。五个核心机制预防了在数据收集之前检测问题:基线污染将起点提升至接近 ceiling,系统提示层级使实验操纵失效,不可能的专家规格导致泛化能力,格式限制抑制推理过程,以及提供者排除限制可推广性。纠正这些限制的受控试验揭示了原始设计掩盖的现实。在此基础上,我们选取GPQA Diamond最难的问题以防止基线模式匹配,迫使依赖真正的专家推理。在有效关键答案的项目上,专家人格实现了接近 ceiling 的准确率。它们通过信心放大消除了所有基线错误。进一步地,通过模型 divergence的 forensic 检查发现,半数的最难GPQA项目包含化学或逻辑上不可接受的答案。模型的CoT揭示了向不可能答案推理的过程,导致对准确化学的惩罚。这些发现重新阐释了原始的空结果。方法上符合规范的persona研究面临由基准有效性限制所施加的测量约束。回答persona问题需要评估基础设施,该领域尚不存在。

关键词

引用

@article{arxiv.2603.20225,
  title  = {The Arrival of AGI? When Expert Personas Exceed Expert Benchmarks},
  author = {Drake Mullens and Stella Shen},
  journal= {arXiv preprint arXiv:2603.20225},
  year   = {2026}
}