中文

使用生成式人工智能应用进行建构性反应评分的效度论证

计算与语言 2025-01-07 v1 人工智能 计算机与社会

摘要

大语言模型与生成式人工智能(AI)能力的快速发展,使其在高利害测试情境中的广泛应用变得更加可能。生成式 AI 在建构性反应评分中的应用尤其具有吸引力,因为它减少了传统 AI 评分中手工构建特征的工作量,甚至可能优于这些方法。本文的目的是突出建构性反应评分系统中基于特征的方法与生成式 AI 应用之间的差异,并提出一套最佳实践,用于收集效度证据以支持使用和解释来自采用生成式 AI 的评分系统的建构性反应分数。我们比较了使用人工评分、基于特征的自然语言处理 AI 评分引擎以及生成式 AI 的评分系统所需的效度证据。由于缺乏透明度以及生成式 AI 独有的其他问题(如一致性),生成式 AI 情境下所需的证据比基于特征的 NLP 评分情境下更为广泛。来自标准化测试的建构性反应评分数据展示了针对不同类型评分系统的效度证据收集过程,并凸显了为这些分数进行效度论证时的诸多复杂性与考量。此外,我们还讨论了 AI 评分评估如何纳入对一种贡献性评分方法的考量——该方法将来自不同来源的多个 AI 评分相结合,从而在缺乏人工评分的情况下覆盖更多的构念。

关键词

引用

@article{arxiv.2501.02334,
  title  = {Validity Arguments For Constructed Response Scoring Using Generative Artificial Intelligence Applications},
  author = {Jodi M. Casabianca and Daniel F. McCaffrey and Matthew S. Johnson and Naim Alper and Vladimir Zubenko},
  journal= {arXiv preprint arXiv:2501.02334},
  year   = {2025}
}

备注

33 pages, 2 figures, 6 tables; This work was presented at the 2024 meeting of the International Testing Commission in Granada, Spain