中文

Gemini Pro 不敌 GPT-4V:来自教育领域的证据

人工智能 2024-01-18 v1 计算与语言

摘要

本研究比较了 Gemini Pro 和 GPT-4V 在教育场景中的分类性能。研究采用视觉问答 (VQA) 技术,考察了两个模型读取基于文本的评分量规并自动对学生绘制的科学教育模型进行评分的能力。我们使用源自学生绘制科学模型的数据集,并采用 NERIF (Notation-Enhanced Rubrics for Image Feedback) 提示方法,进行了定量和定性分析。研究结果显示,GPT-4V 在评分准确性和二次加权 Kappa 系数方面均显著优于 Gemini Pro。定性分析表明,差异可能源于模型处理图像中细粒度文本的能力以及整体图像分类性能。即使通过进一步缩小输入图像尺寸来调整 NERIF 方法,Gemini Pro 似乎仍无法达到 GPT-4V 的性能水平。研究结果表明 GPT-4V 在处理复杂的多模态教育任务方面具有卓越能力。研究结论认为,尽管两种模型都代表了人工智能的进步,但 GPT-4V 更高的性能使其成为涉及多模态数据解释的教育应用中更合适的工具。

关键词

引用

@article{arxiv.2401.08660,
  title  = {Gemini Pro Defeated by GPT-4V: Evidence from Education},
  author = {Gyeong-Geon Lee and Ehsan Latif and Lehong Shi and Xiaoming Zhai},
  journal= {arXiv preprint arXiv:2401.08660},
  year   = {2024}
}