中文

NLP结果的量化可复现性评估

计算与语言 2022-04-13 v1

摘要

本文描述并测试了一种基于计量学概念和定义进行量化可复现性评估(QRA)的方法。QRA基于不同复现所得分数及其差异,产生一个单一分数来估计给定系统与评估指标的可复现程度。我们在18个系统与评估指标组合(涉及多样的NLP任务和评估类型)上测试QRA,每个组合均有原始结果以及一至七个复现结果。所提出的QRA方法产生的可复现程度分数,不仅在相同原始研究、也在不同原始研究的多个复现之间具有可比性。我们发现该方法有助于洞察复现间差异的成因,并能够就系统及/或评估设计的哪些改动可能提升可复现性得出结论。

关键词

引用

@article{arxiv.2204.05961,
  title  = {Quantified Reproducibility Assessment of NLP Results},
  author = {Anya Belz and Maja Popović and Simon Mille},
  journal= {arXiv preprint arXiv:2204.05961},
  year   = {2022}
}

备注

To be published in Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (ACL'22)