聚焦考生作答分布的剑桥多选题阅读数据集分析
计算与语言
2023-10-17 v4
摘要
多选题考试被广泛用于评估考生在不同领域和任务中的能力。为把控题目质量,新提出的题目在投入真实考试前通常需经过预测试评估阶段。目前该评估过程高度依赖人工,可能导致题目开发周期出现时间滞后。通过自动化简化此过程可显著提升效率,然而当前缺乏具有充分预测试分析信息的数据集。本文分析了剑桥大学出版社与评估部发布的公开剑桥多选题阅读数据库的子集;该数据集为针对不同目标等级的多选题理解数据集,并附有相应的考生选择分布。我们提出了考生分布匹配任务,为该任务设计了若干评估指标,并证明在 RACE++ 上训练的自动化系统可用作本任务的基线。我们进一步证明这些自动化系统可用于实际的预测试评估任务,例如检测表现不佳的干扰项,其中我们的检测系统能自动识别极少考生选择的劣质干扰项。
引用
@article{arxiv.2306.13047,
title = {Analysis of the Cambridge Multiple-Choice Questions Reading Dataset with a Focus on Candidate Response Distribution},
author = {Adian Liusie and Vatsal Raina and Andrew Mullooly and Kate Knill and Mark J. F. Gales},
journal= {arXiv preprint arXiv:2306.13047},
year = {2023}
}