不可思议的测试:2024 年无法解决的数据集与 AGI 测验的机会
计算与语言
2024-11-25 v1 人工智能
摘要
本研究引入了一种新型评估框架,用于评估大型语言模型(LLM)在 675 个根本无法解决的问题上承认不确定性的能力。我们使用一个精选的数据集,其中包含旨在故意不可知答案的研究生水平挑战问题,对十二个最先进的 LLM(包括开源和闭源模型)进行评估,评估其在倾向于承认无知而非生成虽然合理但错误响应方面的表现。最佳模型在承认问题解答未知方面得分在 62-68% 的范围内,涵盖生物学、哲学和数学等领域。我们观察到问题难度与模型准确率之间呈反比,GPT-4 在更具挑战性的问题(35.8%)上表现更高,远高于简单问题(20.0%)。这一模式表明,模型在问题看起来更可求解时更容易生成推测性答案。研究还发现不同问题类别间存在显著差异,模型在发明类和 NP 难问题中承认不确定性方面表现不佳,而在哲学和心理学等挑战性较大的领域则相对表现更好。这些结果为人工通用智能(AGI)评估日益增长的研究提供了实证证据,突显了认识自身知识边界这一关键组成部分在未来机器智能评估中的重要性。因此,不可能测试扩展了之前的通用智能测试理论框架,提供了当前 LLM 认识自身知识边界局限性的实证证据,为改进模型训练架构和评估方法的方向提供了新思路。
引用
@article{arxiv.2411.14486,
title = {The Impossible Test: A 2024 Unsolvable Dataset and A Chance for an AGI Quiz},
author = {David Noever and Forrest McKee},
journal= {arXiv preprint arXiv:2411.14486},
year = {2024}
}