ChatGPT 与 Bard 能否生成对齐的测评题目?一项针对人类表现的一致性分析
计算与语言
2023-05-11 v1 人工智能
摘要
ChatGPT 和 Bard 是基于大语言模型(LLM)的 AI 聊天机器人,有望在多个领域得到不同应用。在教育领域,这些 AI 技术已在测评与教学中接受应用测试。在测评方面,AI 长期以来被用于自动作文评分与自动题目生成。这些工具若要辅助或替代人类进行测评,必须具备的一项心理测量特性是 AI 评分与人类评分者之间具有高度一致性可靠性。本文中,我们针对经验丰富且受过训练的人类在感知和评定写作提示复杂度方面的表现,衡量了 OpenAI ChatGPT 与 Google Bard 这两款 LLM 工具的一致性可靠性。以 intraclass correlation(ICC, intraclass 相关系数)作为性能指标显示,OpenAI ChatGPT 与 Google Bard 相对于人类评分这一黄金标准的人机一致性可靠性均较低。
引用
@article{arxiv.2304.05372,
title = {Can ChatGPT and Bard Generate Aligned Assessment Items? A Reliability Analysis against Human Performance},
author = {Abdolvahab Khademi},
journal= {arXiv preprint arXiv:2304.05372},
year = {2023}
}