中文

我们的评测指标需要更新以鼓励泛化能力

计算与语言 2020-07-15 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

在多个流行基准上超越人类表现的模型,在暴露于分布外(OOD)数据时表现出显著的性能退化。近期研究表明,模型会过拟合到虚假偏置并“破解”数据集,而非像人类一样学习可泛化的特征。为了阻止模型性能的虚高——并由此避免对 AI 系统能力的过高估计——我们提出了一种简单而新颖的评测指标,WOOD 分数,以在评测过程中鼓励泛化。

关键词

引用

@article{arxiv.2007.06898,
  title  = {Our Evaluation Metric Needs an Update to Encourage Generalization},
  author = {Swaroop Mishra and Anjana Arunkumar and Chris Bryan and Chitta Baral},
  journal= {arXiv preprint arXiv:2007.06898},
  year   = {2020}
}

备注

Accepted to ICML UDL 2020