中文

通过考察测试集难度理解深度学习性能:一项心理测量案例研究

计算与语言 2018-09-11 v3

摘要

超越测试集准确率来解释深度学习模型的性能具有挑战性。在评估过程中往往不考虑单个数据点的特征,且每个数据点被平等对待。我们考察了测试集问题的难度的影响,以确定难度与性能之间是否存在关系。我们利用基于人类反应模式的经过充分研究的心理测量方法对难度建模。在自然语言推理(NLI)和情感分析(SA)上的实验表明,正确回答问题的可能性受问题难度的影响。随着 DNNs 用更多数据训练,简单样本比较难样本学习得更快。

关键词

引用

@article{arxiv.1702.04811,
  title  = {Understanding Deep Learning Performance through an Examination of Test Set Difficulty: A Psychometric Case Study},
  author = {John P. Lalor and Hao Wu and Tsendsuren Munkhdalai and Hong Yu},
  journal= {arXiv preprint arXiv:1702.04811},
  year   = {2018}
}

备注

EMNLP 2018