AI 与整个广阔世界基准测试
机器学习
2021-12-01 v1 人工智能
性能
摘要
在 AI 的不同子领域中存在一种倾向,即过度推崇一小部分有影响力的基准。这些基准充当了一系列被指定的共性问题的替代品,后者常被框定为通往灵活且可泛化 AI 系统之路上的基础性里程碑。在这些基准上的最先进性能被广泛理解为朝向这些长期目标取得进展的标志。在本立场论文中,我们探究此类基准的局限,以揭示其被设定为具有功能上“通用”的广泛进展度量时,在框架上存在的构念效度问题。
引用
@article{arxiv.2111.15366,
title = {AI and the Everything in the Whole Wide World Benchmark},
author = {Inioluwa Deborah Raji and Emily M. Bender and Amandalynne Paullada and Emily Denton and Alex Hanna},
journal= {arXiv preprint arXiv:2111.15366},
year = {2021}
}
备注
Accepted in NeurIPS 2021 Benchmarks and Datasets track