中文

谁是最佳侦探?LLM 与 ML 在检测不连贯四年级数学作答中的比较

计算与语言 2023-04-25 v1 人工智能 机器学习

摘要

开放式问题的书面作答比选择题对学习具有更长远的影响。然而,教师及时批阅作答并要求重写不连贯的答案至关重要。这对教师而言可能是一项困难且耗时的工作。一种可能的解决方案是自动化检测不连贯答案。一种选择是使用大语言模型(LLM)自动化批阅。本文中,我们使用三种 LLM:GPT-3、BLOOM 和 YOU,分析四年级学生的数学作答,并采用零、一、二、三和四样本设置。我们将它们的性能与用机器学习(ML)训练的各种分类器结果进行比较。我们发现 LLM 在检测不连贯答案上表现劣于 ML。困难似乎在于包含问题与答案的递归式题目,以及具有典型四年级拼写错误的学生回答。进一步审视发现,ChatGPT 模型面临相同挑战。

关键词

引用

@article{arxiv.2304.11257,
  title  = {Who's the Best Detective? LLMs vs. MLs in Detecting Incoherent Fourth Grade Math Answers},
  author = {Felipe Urrutia and Roberto Araya},
  journal= {arXiv preprint arXiv:2304.11257},
  year   = {2023}
}