QRA++:自然语言处理中常见结果类型的量化可重复性评估
计算与语言
2025-05-26 v1 人工智能
摘要
在 NLP 中报告的复现研究提供了单个数据点,组合起来显示出该领域可重复性水平令人担忧地低下。由于每个复现研究都基于其自身、常不明确说明的复现成功/失败标准作出定量结论,所得结论难以解读、比较和学习。本文提出 QRA++,一种量化可重复性评估方法,能够(i)在三个层次的细粒度上产生连续型可重复性评估;(ii)利用可跨不同研究直接比较的可重复性度量;(iii)将可重复性程度的期望置于实验相似性之上。QRA++ 能够进行更有信息量的可重复性评估,并就导致可重复性更好/更差的原因作出结论。我们通过将 QRA++ 应用于三个可比实验集合来说明这一点,揭示了可重复性程度取决于实验属性相似性,但也取决于系统类型和评估方法的明确证据。
引用
@article{arxiv.2505.17043,
title = {QRA++: Quantified Reproducibility Assessment for Common Types of Results in Natural Language Processing},
author = {Anya Belz},
journal= {arXiv preprint arXiv:2505.17043},
year = {2025}
}