中文

计算教育会议中的“中等样本量研究”

计算机与社会 2024-08-06 v2 统计方法学

摘要

良好的(频率学派)统计实践要求执行统计检验,以确定所观察到的现象在零假设为假时是否可能由偶然因素导致。良好实践还要求,若研究效力不足(即观测数量不足以在效应存在时可靠地检测到所假设的效应),则不应执行检验。开展效力不足的研究存在得到假阴性结果的风险。这在计算机科学教育会议的指南与期望中造成了张力:虽然对观测数量众多的研究而言规则明确,但若观测数量过少,研究者实际上不应计算 p 值并执行统计检验。该问题在计算机科学教育(CSed)场合尤为突出,因为相关班级规模较小的情况十分常见。我们概述了计算机科学教育研究者在各异环境中何时该计算、何时不该计算 p 值的考量。我们调查了不同计算机科学教育会议(ICER、SIGCSE TS、ITiCSE、EAAI、CompEd、Koli Calling)的作者与审稿人指南。我们呈现了汇总数据,并就审稿人指南提出若干初步观察:各会议指南不尽相同;指南允许质性研究,某些情况下也允许经验报告,但指南通常未明确表明论文应至少具备(1)适当效力的统计分析或(2)丰富的质性描述之一。我们提出了解决小样本量与大样本量研究间指南张力的初步构想。

关键词

引用

@article{arxiv.2311.14679,
  title  = {"Medium-n studies" in computing education conferences},
  author = {Michael Guerzhoy},
  journal= {arXiv preprint arXiv:2311.14679},
  year   = {2024}
}

备注

Koli Calling 2023: 23rd International Conference on Computing Education Research