中文

用项目反应理论比较测试集

计算与语言 2021-06-03 v1

摘要

近年来出现了大量NLP数据集,用于评估微调模型在自然语言理解任务上的表现。然而,大型预训练模型近期的结果表明,其中许多数据集已大体饱和,不太可能检测出进一步进展。何种数据集仍能有效区分强模型,我们又应预期何种数据集能够检测未来改进?为跨数据集统一度量这一点,我们借助项目反应理论,利用18个预训练Transformer模型对单个测试样例的预测来评估29个数据集。我们发现Quoref、HellaSwag和MC-TACO最适于区分最先进模型,而SNLI、MNLI和CommitmentBank对当前强模型似乎已饱和。我们还观察到用于QAMR或SQuAD2.0等QA数据集的跨度选择任务格式,在区分强模型与弱模型方面是有效的。

关键词

引用

@article{arxiv.2106.00840,
  title  = {Comparing Test Sets with Item Response Theory},
  author = {Clara Vania and Phu Mon Htut and William Huang and Dhara Mungra and Richard Yuanzhe Pang and Jason Phang and Haokun Liu and Kyunghyun Cho and Samuel R. Bowman},
  journal= {arXiv preprint arXiv:2106.00840},
  year   = {2021}
}

备注

ACL 2021