修复自然语言理解基准测试需要什么?
计算与语言
2021-10-19 v3
摘要
许多自然语言理解(NLU)任务的评估已经失效:不可靠且有偏的系统在标准基准上得分极高,以至于开发更好系统的研究者几乎无法展示其改进。近期放弃独立同分布(IID)基准、转而采用对抗性构建的分布外测试集的趋势,虽确保了当前模型表现糟糕,但最终只是掩盖了我们期望基准所衡量的能力。在本立场论文中,我们提出我们认为 NLU 基准应满足的四条标准。我们认为大多数当前基准不符合这些标准,且对抗性数据收集并未切实解决这些失败的根源。相反,恢复健康的评估生态需要在基准数据集的设计、标注的可靠性、数据集规模以及处理社会偏见的方式上取得显著进展。
引用
@article{arxiv.2104.02145,
title = {What Will it Take to Fix Benchmarking in Natural Language Understanding?},
author = {Samuel R. Bowman and George E. Dahl},
journal= {arXiv preprint arXiv:2104.02145},
year = {2021}
}
备注
Proceedings of NAACL 2020. This revision adds a missing acknowledgment