中文

利用 ChatGPT 对作文及短篇结构化作答进行评分

计算与语言 2024-08-20 v1 人工智能

摘要

本研究旨在确定 ChatGPT 的大型语言模型是否能够匹配人类和机器评分在 ASAP 竞赛中的评分准确度。该研究聚焦于 various prediction models,包括线性回归、随机森林、梯度提升和 boost。对 ChatGPT 的表现以二次加权 Kappa (QWK) 指标对人类评分者进行评估。结果表明,尽管 ChatGPT 的梯度提升模型在某些数据集上实现了接近人类评分者的 QWK,但其整体表现不一致且常常低于人类得分。该研究强调,在处理偏见和确保评分公平方面仍需进一步细化。尽管存在这些挑战,ChatGPT 仍显示出在评分效率方面的潜力,特别是针对特定领域的微调。该研究得出结论,ChatGPT 可补充人类评分,但需额外发展才能可靠地用于高风险评估。未来研究应改进模型准确度、解决伦理问题,并探索将 ChatGPT 与经验方法结合的混合模型。

关键词

引用

@article{arxiv.2408.09540,
  title  = {Using ChatGPT to Score Essays and Short-Form Constructed Responses},
  author = {Mark D. Shermis},
  journal= {arXiv preprint arXiv:2408.09540},
  year   = {2024}
}

备注

35 pages, 8 tables, 2 Figures, 27 references