中文

人工智能工具在评估内容有效性中的应用:基于人类专家的比较研究

人机交互 2025-03-21 v1 人工智能 计算机与社会

摘要

本研究探讨了人工智能评估器是否以类似于人类评估器的方式评估B1水平英语阅读理解测试项目的内容有效性。开发了一个包含25个题目的多项选择测试,这些测试项目由四名人类评估器和四名AI评估器进行评估。在人类和AI评估器给出的分数之间未发现统计学上的显著差异,评估趋势也相似。使用 Wilcoxon 符号秩检验计算和分析内容有效性比率(CVR)和项目内容有效性指数(I-CVI),未发现统计学上的显著差异。研究结果表明,在某些情况下,AI评估器可以取代人类评估器。然而,特定题目的差异可能源于对评估标准的不同解释。确保语言清晰性并明确定义标准可有助于获得更一致的评估。在此方面,建议开发混合评估系统,即在人类专家的帮助下使用AI技术。

关键词

引用

@article{arxiv.2503.15525,
  title  = {The Use of Artificial Intelligence Tools in Assessing Content Validity: A Comparative Study with Human Experts},
  author = {Hatice Gurdil and Hatice Ozlem Anadol and Yesim Beril Soguksu},
  journal= {arXiv preprint arXiv:2503.15525},
  year   = {2025}
}