在 GMAT 上评估大语言模型:对商业教育未来的启示
计算与语言
2024-01-09 v1 人工智能
摘要
人工智能 (AI) 的快速发展,特别是在 Large Language Models (LLMs) 和生成式 AI 领域,为各个领域的应用开辟了新途径,但其在商业教育中的作用仍未被充分探索。本研究引入了首个基准,用于评估七个主要 LLM 在 GMAT(一项研究生商业项目录取过程中的关键考试)上的表现,包括 OpenAI 的模型 (GPT-3.5 Turbo, GPT-4, 和 GPT-4 Turbo)、Google 的模型 (PaLM 2, Gemini 1.0 Pro) 以及 Anthropic 的模型 (Claude 2 和 Claude 2.1)。我们的分析表明,大多数 LLM 优于人类考生,其中 GPT-4 Turbo 不仅优于其他模型,而且超过了顶尖商学院研究生的平均分。通过案例研究,本研究考察了 GPT-4 Turbo 解释答案、评估回答、识别错误、定制指令和生成替代场景的能力。与早期版本相比,最新的 LLM 版本 GPT-4 Turbo、Claude 2.1 和 Gemini 1.0 Pro 在推理任务上表现出显著改进,突显了它们在复杂问题解决中的潜力。尽管 AI 在教育、评估和辅导方面的前景已很明确,但挑战依然存在。我们的研究不仅阐明了 LLM 的学术潜力,而且强调了在教育中谨慎开发和应用 AI 的必要性。随着 AI 技术的进步,建立 AI 交互的框架和协议、验证 AI 生成内容的准确性、确保全球多元化学习者的访问权限,以及创造 AI 辅助人类专业知识的教育环境势在必行。这项研究为进一步探索利用 AI 丰富教育体验、改善考试准备和评估方法的责任化使用奠定了基础。
引用
@article{arxiv.2401.02985,
title = {Evaluating Large Language Models on the GMAT: Implications for the Future of Business Education},
author = {Vahid Ashrafimoghari and Necdet Gürkan and Jordan W. Suchow},
journal= {arXiv preprint arXiv:2401.02985},
year = {2024}
}