GPT-4是可靠的评分者吗?评估GPT-4文本评分的一致性
计算与语言
2024-01-19 v1 人工智能
摘要
本研究调查了OpenAI的GPT-4(一种最先进的人工智能语言模型)在多次迭代、时间跨度和风格变化下生成的反馈评分的一致性。该模型从内容和风格两方面对高等教育(HE)宏观经济学学科领域内的任务响应进行评分。为深入了解评分者间可靠性、跨迭代评分的一致性以及内容与风格评分之间的相关性,进行了统计分析。结果显示出高评分者间可靠性,不同时间跨度的ICC分数介于0.94和0.99之间,表明GPT-4能够在具有清晰提示的重复中生成一致评分。风格与内容评分显示出0.87的高相关性。当应用不恰当的风格时,平均内容评分保持不变,而风格评分下降,这表明大语言模型(LLM)在评估过程中有效区分了这两个标准。本研究使用并解释的提示亦予以呈现。进一步的研究有必要评估AI模型在各种用例中的鲁棒性和可靠性。
引用
@article{arxiv.2308.02575,
title = {Is GPT-4 a reliable rater? Evaluating Consistency in GPT-4 Text Ratings},
author = {Veronika Hackl and Alexandra Elena Müller and Michael Granitzer and Maximilian Sailer},
journal= {arXiv preprint arXiv:2308.02575},
year = {2024}
}
备注
14 pages, 7 tables, 1 figure