评判裁判:国际体操裁判表现评估
应用统计
2019-08-19 v3
摘要
对体操成套动作进行评判是一个有噪声的过程,且裁判的表现差异很大。我们与 Fédération Internationale de Gymnastique (FIG) 和 Longines 合作,正在设计和实施一个改进的统计引擎,用于分析和评估体操裁判在奥运会和世界锦标赛等大型赛事期间及赛后的表现。该引擎称为裁判评估程序(JEP),有三个目标:(1) 向裁判、执行委员会和国家联合会提供建设性反馈;(2) 将最优秀的裁判指派给最重要的赛事;(3) 检测偏倚和公然作弊。利用 2013–2016 奥运周期期间举办的国际体操赛事数据,我们首先开发了一个评分分数,用于评估体操裁判所给分数的准确性。对体操成套动作的评判是一个随机过程,我们可以使用异方差随机变量非常精确地对此过程建模。该评分分数将裁判的分数与体操运动员理论表现之间的差异,按从各器械数据估计的评判误差标准差进行缩放。这种评判变异性与表现质量之间的依赖关系此前从未被恰当研究过。随后我们研究了排序分数,以评估裁判在多大程度上将体操运动员按正确顺序评级,并解释了为何我们最终选择不实施它们。我们还研究了离群值检测,以 pinpoint( pinpoint:精确定位)那些被裁判评价很差的体操运动员。最后,我们讨论了有趣的观察和发现,这些导致了 FIG 的建议和规则变更。
引用
@article{arxiv.1807.10021,
title = {Judging the Judges: Evaluating the Performance of International Gymnastics Judges},
author = {Hugues Mercier and Sandro Heiniger},
journal= {arXiv preprint arXiv:1807.10021},
year = {2019}
}