中文

大语言模型与人类评分者评分理由的比较

计算与语言 2025-09-30 v1 机器学习

摘要

自动评分的发展与机器学习和自然语言处理技术的进步密切相关。随着大语言模型(LLM)的最新进展,利用ChatGPT、Gemini、Claude和其他生成式AI聊天机器人进行自动评分已被探索。由于其强大的推理能力,LLM还可以生成支持其分配分数的理由。因此,评估人类评分者和LLM评分者提供的理由有助于加深对每种评分者在分配分数时所应用推理的理解。本研究调查了人类和LLM评分者的理由,以识别评分不一致的潜在原因。利用大规模测试中的作文,基于二次加权kappa和归一化互信息检验了GPT-4o、Gemini和其他LLM的评分准确性。使用余弦相似度评估所提供理由的相似性。此外,通过基于理由嵌入的主成分分析探索了理由中的聚类模式。本研究的发现为理解LLM在自动评分中的准确性和"思考"过程提供了见解,有助于加深对人类评分和基于LLM的自动评分背后理由的理解。

关键词

引用

@article{arxiv.2509.23412,
  title  = {Comparison of Scoring Rationales Between Large Language Models and Human Raters},
  author = {Haowei Hua and Hong Jiao and Dan Song},
  journal= {arXiv preprint arXiv:2509.23412},
  year   = {2025}
}

备注

23 Pages, 4 Tables, 13 Figures