评估 LLM 解决 POSCOMP 试题的能力
摘要
大语言模型(LLM)的最新进展显著扩展了人工智能在自然语言处理任务中的能力。尽管取得了这些进展,但它们在计算机科学等专业领域的性能仍相对未被探索。了解 LLM 在这些领域的熟练程度对于评估其实用价值及指导未来发展至关重要。POSCOMP 是一项由巴西计算机学会(SBC)主办的、用于计算机科学研究生入学的著名巴西考试,提供了一个极具挑战性的基准。本研究调查了 LLM 能否在 POSCOMP 考试上匹敌或超越人类表现。四个 LLM——ChatGPT-4、Gemini 1.0 Advanced、Claude 3 Sonnet 和 Le Chat Mistral Large——最初在 2022 年和 2023 年的 POSCOMP 考试上进行了评估。这些评估衡量了模型处理考试中典型复杂问题的能力。LLM 在基于文本的问题上的表现明显优于图像解释任务。在 2022 年的考试中,ChatGPT-4 以 69 道题中答对 57 道的成绩领先,其次是 Gemini 1.0 Advanced(49)、Le Chat Mistral(48)和 Claude 3 Sonnet(44)。在 2023 年的考试中也观察到了类似的趋势。ChatGPT-4 取得了最高性能,超越了所有参加 2023 年 POSCOMP 考试的学生。LLM,尤其是 ChatGPT-4,在 POSCOMP 考试的基于文本的任务上展现出潜力,尽管图像解释仍是一个挑战。鉴于 LLM 的快速演进,我们扩展了分析,纳入了更新的模型——o1、Gemini 2.5 Pro、Claude 3.7 Sonnet 和 o3-mini-high——并在 2022 至 2024 年的 POSCOMP 考试上进行了评估。这些较新的模型展现出进一步的提升,并在所有三年中始终超越人类参与者的平均水平和最高表现者。
引用
@article{arxiv.2505.20338,
title = {Assessing the Capability of LLMs in Solving POSCOMP Questions},
author = {Cayo Viegas and Rohit Gheyi and Márcio Ribeiro},
journal= {arXiv preprint arXiv:2505.20338},
year = {2025}
}