中文

大语言模型与人类评分者在定性分析中的评分者间信度研究

物理教育 2025-09-03 v2

摘要

定性分析通常受限于小数据集,因为它是耗时的。此外,需要第二位人类评分者来确保可靠的发现。如果我们能证明人工智能工具与人类评分相比具有高可靠性,它们可能取代人类评分者。我们研究了最先进的大语言模型(LLMs)——ChatGPT-4o和ChatGPT-4.5-preview——在评分手动编码的音频转录文本时的评分者间信度。我们探索了提示词和超参数以优化模型性能。参与者来自美国中西部一所大学的14个本科生小组,他们讨论了项目的解题策略。我们提示LLM复制手动编码,并计算Cohen's Kappa以评估评分者间信度。在优化模型超参数和提示词后,结果显示三个主题具有实质性一致性(κ>0.6),一个主题具有中等一致性。我们的发现展示了GPT-4o和GPT-4.5在物理教育中高效、可扩展的定性分析的潜力,并识别了它们在评分领域通用构念方面的局限性。

关键词

引用

@article{arxiv.2508.14764,
  title  = {Investigation of the Inter-Rater Reliability between Large Language Models and Human Raters in Qualitative Analysis},
  author = {Nikhil Sanjay Borse and Ravishankar Chatta Subramaniam and N. Sanjay Rebello},
  journal= {arXiv preprint arXiv:2508.14764},
  year   = {2025}
}

备注

7 pages, 4 figures, Physics Education Research Conference 2025