中文

大型语言模型作为英语作文自动评分工具的实证研究——以 TOEFL 独立写作任务为例

计算与语言 2024-01-09 v1

摘要

大型语言模型在涉及自然语言生成、推理和理解的任务中表现出了卓越的能力。本研究旨在根据官方 TOEFL 指南中阐述的多样化评分标准构建提示和评论。主要目标是评估大型语言模型的杰出代表 ChatGPT 在自动作文评分背景下的能力和局限性。自动作文评分的现行方法涉及使用深度神经网络、统计机器学习技术和微调预训练模型。然而,由于这些数据需求量大且对小样本量的适应性有限,这些技术在应用于不同语境或主题时面临挑战。相比之下,本研究采用实验方法,利用 ChatGPT 对英语作文进行自动评估,即使在小样本量的情况下也是如此。实证结果表明,ChatGPT 可以为自动作文评分提供操作功能,尽管结果表现出回归效应。必须强调的是,ChatGPT 提示的有效设计和实施需要深厚的领域专业知识和技术能力,因为这些提示受到特定阈值标准的约束。

关键词

引用

@article{arxiv.2401.03401,
  title  = {Empirical Study of Large Language Models as Automated Essay Scoring Tools in English Composition__Taking TOEFL Independent Writing Task for Example},
  author = {Wei Xia and Shaoguang Mao and Chanjing Zheng},
  journal= {arXiv preprint arXiv:2401.03401},
  year   = {2024}
}