阿尔沃拉德-基准:语言模型能否解答巴西大学入学考试?
计算与语言
2025-08-25 v1 人工智能
摘要
语言模型在巴西日益增多地被使用,但大多数评估仍以英语为中心。本文提出阿尔沃拉德-基准 (Alvorada-Bench),这是从五所巴西大学入学考试中抽取的 4,515 题、纯文本基准数据集。在零-shot、角色扮演和链式思考提示下对二十个模型进行评估,产生 270,900 项响应,包含结构化的自报告置信度、感知难度和布卢姆水平。前景模型在整体上准确率超过 94%,但在数学题目以及针对工程导向的 IME 和 ITA 考试中准确率下降,表明在多步骤推理方面仍存在薄弱环节。置信度在校准良好且与感知难度相关,表明模型能够准确评估自身的确定性。成本-准确率分析表明,在每 1000 个 token 花费不到 2 美元的情况下仍可实现高准确率。在 ENEM 2024 上,最佳模型 (O3) 在语言科目题目中取得完美得分,而最弱的系统 (GPT-4.1 Nano) 仅在数学中未能超越人类水平。通过提炼巴西教育历数十年的教育优先事项并每年评估数百万学生的考试,阿尔沃拉德-基准确立了语言模型能否在语言、文化与推理交汇的领域中把握以定义巴西学术准备水平的能力。
引用
@article{arxiv.2508.15835,
title = {Alvorada-Bench: Can Language Models Solve Brazilian University Entrance Exams?},
author = {Henrique Godoy},
journal= {arXiv preprint arXiv:2508.15835},
year = {2025}
}