中文

微调ChatGPT用于中文科学解释的自动评分

人工智能 2025-01-14 v1 计算与语言

摘要

对科学现象进行解释的发展在科学评估中至关重要,但对学生的书面解释进行评分仍然具有挑战性且耗费大量资源。大语言模型(LLMs)在解决这一问题方面展现出了潜力,尤其是在英语等字母语言中。然而,它们在表意语言中的适用性却较少被探讨。本研究调查了微调领先的LLM——ChatGPT,以自动对中文科学解释进行评分的潜力。我们收集了学生对七项科学解释任务的回答并进行了自动评分,使用Kendall相关系数检验了评分准确性与推理复杂性之间的关系。定性分析探讨了语言特征如何影响评分准确性。结果表明,特定领域的适应使ChatGPT能够准确地对中文科学解释进行评分。然而,评分准确性与推理复杂性相关:对于低水平回答呈负相关,对于高水平回答呈正相关。模型高估了具有复杂句子结构的低水平回答中的复杂推理,而低估了使用简洁因果推理的高水平回答。这些相关性源于语言特征——简单和清晰提高了低水平回答的准确性,而全面性提高了高水平回答的准确性。更简单、更短的回答在较低水平上评分往往更准确,而更长、信息更丰富的回答在较高水平上能产生更好的准确性。这些发现证明了LLMs在中文环境下自动评分的有效性,并强调了语言特征和推理复杂性在微调教育评估评分模型中的重要性。

关键词

引用

@article{arxiv.2501.06704,
  title  = {Fine-tuning ChatGPT for Automatic Scoring of Written Scientific Explanations in Chinese},
  author = {Jie Yang and Ehsan Latif and Yuze He and Xiaoming Zhai},
  journal= {arXiv preprint arXiv:2501.06704},
  year   = {2025}
}