中文

并非所有主张生而平等:选择恰当的统计方法评估假设

计算与语言 2020-05-06 v3 人工智能

摘要

自然语言处理(NLP)中的实证研究采用了狭隘的假设评估原则,主要依赖 p 值计算,而该方法存在若干已知问题。尽管替代方案在其他领域已被充分讨论并采纳,它们在 NLP 社区内仍鲜少被讨论或使用。我们对比多种假设评估技术,尤其是该领域不常用的技术(如基于贝叶斯推断的评估),以弥补这一缺口。由于这些统计技术在可支持的假设上各不相同,我们认为实践者应首先在确定目标假设后再选择评估方法。这一点至关重要,因为围绕假设评估方法的常见谬误、误解与误读往往源于人们想要主张的内容与所用方法实际评估的内容之间的偏差。我们的调查显示,这些问题在 NLP 研究界普遍存在。作为改进的一步,我们提供了针对 NLP 研究的最佳实践与指南,以及一个易于使用的名为 'HyBayes' 的包用于假设的贝叶斯评估,作为对现有工具的补充。

关键词

引用

@article{arxiv.1911.03850,
  title  = {Not All Claims are Created Equal: Choosing the Right Statistical Approach to Assess Hypotheses},
  author = {Erfan Sadeqi Azer and Daniel Khashabi and Ashish Sabharwal and Dan Roth},
  journal= {arXiv preprint arXiv:1911.03850},
  year   = {2020}
}

备注

ACL 2020