展示你的工作并非总是有效
计算与语言
2020-04-29 v1 机器学习
摘要
在自然语言处理领域,近期一条热门研究路线探讨了如何最佳地报告神经网络的实验结果。一篇题为《展示你的工作:改进实验结果的报告》的代表性论文主张,应针对计算预算报告最佳调优模型的期望验证效能。在本文中,我们批判性地审视了该论文。就统计泛化性而言,我们发现该方法存在未明言的陷阱与注意事项。我们分析表明,其估计量是有偏的,并且使用了易出错的假设。我们发现该估计量偏向于负误差,并产生不良的 bootstrap 置信区间。我们推导出一个无偏的替代方案,并通过统计模拟的实证证据来支持我们的主张。我们的代码库位于 http://github.com/castorini/meanmax。
引用
@article{arxiv.2004.13705,
title = {Showing Your Work Doesn't Always Work},
author = {Raphael Tang and Jaejun Lee and Ji Xin and Xinyu Liu and Yaoliang Yu and Jimmy Lin},
journal= {arXiv preprint arXiv:2004.13705},
year = {2020}
}
备注
Accepted to ACL 2020