我们的评测指标需要更新以鼓励泛化能力
计算与语言
2020-07-15 v1 人工智能
计算机视觉与模式识别
机器学习
摘要
在多个流行基准上超越人类表现的模型,在暴露于分布外(OOD)数据时表现出显著的性能退化。近期研究表明,模型会过拟合到虚假偏置并“破解”数据集,而非像人类一样学习可泛化的特征。为了阻止模型性能的虚高——并由此避免对 AI 系统能力的过高估计——我们提出了一种简单而新颖的评测指标,WOOD 分数,以在评测过程中鼓励泛化。
引用
@article{arxiv.2007.06898,
title = {Our Evaluation Metric Needs an Update to Encourage Generalization},
author = {Swaroop Mishra and Anjana Arunkumar and Chris Bryan and Chitta Baral},
journal= {arXiv preprint arXiv:2007.06898},
year = {2020}
}
备注
Accepted to ICML UDL 2020