NLP 中的可复现性:我们从检查清单中学到了什么?
计算与语言
2023-06-19 v1
摘要
NLP 领域的科学进展依赖于研究者论断的可复现性。*CL 会议于 2020 年创建了 NLP 可复现性检查清单,由作者在投稿时填写,以提醒他们包含关键信息。我们通过对 10,405 份匿名填写结果的考察,提供了对该检查清单的首次分析。首先,我们发现自检查清单引入后,关于效率、验证性能、汇总统计量和超参数的信息报告有所增多。此外,我们显示“是”回答更多的投稿其录用率更高。我们发现收集新数据的投稿占 44%,其被录用的可能性比未收集新数据的投稿低 5%;这些投稿的平均评审者评定可复现性也比其他投稿低 2%。我们发现仅有 46% 的投稿声称开源其代码,尽管这样做的投稿相对于未开源的投稿可复现性得分高 8%,为所有条目中之最。我们讨论了关于 NLP 可复现性现状可推知的内容,并为未来会议提供了一系列建议,包括:a) 允许在截止日期后一周内提交代码与附录;b) 通过数据收集实践检查清单来衡量数据集可复现性。
引用
@article{arxiv.2306.09562,
title = {Reproducibility in NLP: What Have We Learned from the Checklist?},
author = {Ian Magnusson and Noah A. Smith and Jesse Dodge},
journal= {arXiv preprint arXiv:2306.09562},
year = {2023}
}
备注
To be published in ACL 2023 Findings