中文

在巴西大学入学考试中评估 GPT-3.5 与 GPT-4 模型

计算与语言 2023-03-31 v1 人工智能 机器学习

摘要

本研究旨在探索语言模型(LM)应对高风险选择题测试的能力,此处以巴西大学广泛采用的跨学科入学考试 Exame Nacional do Ensino Médio(ENEM)为代表。该考试对语言模型提出了挑战性任务,因为其题目可能跨越多个知识领域,需要理解来自不同领域的信息。例如,一道题可能同时需要统计与生物学的理解才能解答。本工作分析了 GPT-3.5 和 GPT-4 模型对 2009–2017 年考试题目以及 2022 年考试题目的生成回答,后者在模型训练完成后才公开。此外,测试了不同的提示策略,包括使用思维链(CoT)提示来生成答案解释。在 2022 年版中,性能最佳的模型 GPT-4 配 CoT 达到了 87% 的准确率,大幅超越 GPT-3.5 达 11 分。实验所用的代码与数据可在 https://github.com/piresramon/gpt-4-enem 获取。

关键词

引用

@article{arxiv.2303.17003,
  title  = {Evaluating GPT-3.5 and GPT-4 Models on Brazilian University Admission Exams},
  author = {Desnes Nunes and Ricardo Primi and Ramon Pires and Roberto Lotufo and Rodrigo Nogueira},
  journal= {arXiv preprint arXiv:2303.17003},
  year   = {2023}
}