中文

ChatGPT与Gemini参加韩国大学学业能力考试——地球科学I

人工智能 2025-12-18 v1 计算与语言 计算机与社会

摘要

生成式人工智能的快速发展正在给教育和评估带来创新性变革。随着学生使用AI完成作业的普遍性增加,关于学术诚信和评估有效性的担忧日益增长。本研究利用2025年韩国大学学业能力考试(CSAT)的地球科学I部分,深入分析了最先进的大语言模型(LLMs),包括GPT-4o、Gemini 2.5 Flash和Gemini 2.5 Pro的多模态科学推理能力和认知局限性。设计了三种实验条件(整页输入、单项输入和优化多模态输入)来评估模型在不同数据结构下的性能。定量结果表明,由于分割和光学字符识别(OCR)失败,非结构化输入导致性能显著下降。即使在优化条件下,模型也表现出基本的推理缺陷。定性分析显示,"感知错误"占主导地位,凸显了"感知-认知差距",即模型尽管识别了视觉数据,却无法解释示意图中的符号含义。此外,模型表现出"计算-概念化差异",即成功执行计算却未能应用潜在的科学概念,以及"过程幻觉",即模型跳过视觉验证而倾向于看似合理但毫无根据的背景知识。针对课程作业中未经授权使用AI的挑战,本研究为设计针对这些特定认知弱点的"抗AI问题"提供了可行的线索。通过利用AI的弱点,如感知与认知之间的差距,教育工作者可以区分学生的真实能力与AI生成的回答,从而确保评估的公平性。

关键词

引用

@article{arxiv.2512.15298,
  title  = {ChatGPT and Gemini participated in the Korean College Scholastic Ability Test -- Earth Science I},
  author = {Seok-Hyun Ga and Chun-Yen Chang},
  journal= {arXiv preprint arXiv:2512.15298},
  year   = {2025}
}

备注

23 pages, 9 tables, 1 figure