动态智能评估:聚焦模型置信度对 LLM 进行 AGI 路上的基准测试
人工智能
2024-11-26 v3 多智能体系统
摘要
随着机器智能的演变,对不同 AI 模型进行问题解决能力测试和比较的需求日益增长。然而,当前的基准测试往往过于简单,允许模型表现均匀,难以区分其能力。此外,基准测试通常依赖于静态的问答对,这些问答对模型可能会记忆或猜测。为克服这些限制,我们引入动态智能评估 (Dynamic Intelligence Assessment, DIA),这是一种用于测试 AI 模型的新方法,采用动态问题模板和改进的指标,对多个学科进行测试,包括数学、密码学、网络安全和计算机科学。随附的数据集 DIA-Bench 包含多样化的挑战模板,这些模板参数可变,呈现形式多样,包括文本、PDF、编译二进制文件、视觉拼图和 CTF 风格的网络安全挑战。我们的框架引入了四个新的指标来评估模型在多次尝试中的可靠性和置信度。这些指标揭示了即使是简单问题在不同形式下也常常被错误回答,凸显了模型可靠性的重大缺口。值得注意的是,API 模型如 GPT-4o 常常高估了其数学能力,而 ChatGPT-4o 由于有效的工具使用表现更佳。在自我评估方面,OpenAI 的 o1-mini 在判断应尝试解决的任务方面表现最佳。我们使用 DIA-Bench 对 25 个最先进的 LLM 进行评估,显示当前模型在复杂任务上仍感到困难,甚至在较简单问题时也显示出意外的低置信度。DIA 框架为评估不仅是问题解决能力,还包括模型的自适应智能和自我局限性评估设定了新的标准。该数据集已在项目页面上公开提供:https://github.com/DIA-Bench。
引用
@article{arxiv.2410.15490,
title = {Dynamic Intelligence Assessment: Benchmarking LLMs on the Road to AGI with a Focus on Model Confidence},
author = {Norbert Tihanyi and Tamas Bisztray and Richard A. Dubniczky and Rebeka Toth and Bertalan Borsos and Bilel Cherif and Mohamed Amine Ferrag and Lajos Muzsai and Ridhi Jain and Ryan Marinelli and Lucas C. Cordeiro and Merouane Debbah and Vasileios Mavroeidis and Audun Josang},
journal= {arXiv preprint arXiv:2410.15490},
year = {2024}
}