中文

评估大型语言模型在西班牙语本科入学考试中的表现

计算与语言 2023-12-29 v1 人工智能

摘要

本研究评估了大型语言模型,特别是 GPT-3.5 和 BARD(由 Gemini Pro 模型支持),在墨西哥国家理工学院提出的本科入学考试中的表现。考试涵盖工程/数学与物理科学、生物与医学科学以及社会与行政科学。两个模型均表现出色,超过了部分学术项目的最低录取分数,最高达到 75%。GPT-3.5 在数学和物理方面优于 BARD,而 BARD 在历史和与事实信息相关的问题上表现更好。总体而言,GPT-3.5 以 60.94% 的得分略微超过 BARD 的 60.42%。

关键词

引用

@article{arxiv.2312.16845,
  title  = {Evaluating the Performance of Large Language Models for Spanish Language in Undergraduate Admissions Exams},
  author = {Sabino Miranda and Obdulia Pichardo-Lagunas and Bella Martínez-Seis and Pierre Baldi},
  journal= {arXiv preprint arXiv:2312.16845},
  year   = {2023}
}

备注

11 pages, 1 figure. Submitted to a journal