中文

展示你的工作并非总是有效

计算与语言 2020-04-29 v1 机器学习

摘要

在自然语言处理领域,近期一条热门研究路线探讨了如何最佳地报告神经网络的实验结果。一篇题为《展示你的工作:改进实验结果的报告》的代表性论文主张,应针对计算预算报告最佳调优模型的期望验证效能。在本文中,我们批判性地审视了该论文。就统计泛化性而言,我们发现该方法存在未明言的陷阱与注意事项。我们分析表明,其估计量是有偏的,并且使用了易出错的假设。我们发现该估计量偏向于负误差,并产生不良的 bootstrap 置信区间。我们推导出一个无偏的替代方案,并通过统计模拟的实证证据来支持我们的主张。我们的代码库位于 http://github.com/castorini/meanmax。

关键词

引用

@article{arxiv.2004.13705,
  title  = {Showing Your Work Doesn't Always Work},
  author = {Raphael Tang and Jaejun Lee and Ji Xin and Xinyu Liu and Yaoliang Yu and Jimmy Lin},
  journal= {arXiv preprint arXiv:2004.13705},
  year   = {2020}
}

备注

Accepted to ACL 2020