中文

衡量神经模型的视觉 - 语言 STEM 技能

计算与语言 2024-05-24 v3 人工智能 机器学习

摘要

我们引入了一项新的挑战来测试神经模型的 STEM 技能。现实世界中的问题往往需要结合科学、技术、工程和数学(STEM)知识的解决方案。与现有数据集不同,我们的数据集要求理解 STEM 的多模态视觉 - 语言信息。我们的数据集是该挑战最大且最全面的数据集之一,包含跨越所有 STEM 学科的 448 项技能和 1,073,146 个问题。与通常侧重于考察专家级能力的现有数据集相比,我们的数据集包含了基于 K-12 课程设计的基礎技能和问题。我们还将 CLIP 和 GPT-3.5-Turbo 等最先进的基础模型纳入我们的基准测试。结果显示,近期的模型进步仅有助于掌握我们数据集中极少数低年级技能(三年级仅为 2.5%)。事实上,这些模型的表现仍远低于(平均 54.7%)小学生的水平,更不用说接近专家级表现。为了理解并提高在我们数据集上的表现,我们在数据集的训练集上对模型进行了训练。尽管我们观察到了性能提升,但与平均小学生相比,模型表现仍然相对较低。要解决 STEM 问题,我们需要社区提出新颖的算法创新。

关键词

引用

@article{arxiv.2402.17205,
  title  = {Measuring Vision-Language STEM Skills of Neural Models},
  author = {Jianhao Shen and Ye Yuan and Srbuhi Mirzoyan and Ming Zhang and Chenguang Wang},
  journal= {arXiv preprint arXiv:2402.17205},
  year   = {2024}
}

备注

Accepted in ICLR 2024