中文

CommonsenseQA 2.0:通过游戏化揭示人工智能的局限

计算与语言 2022-01-17 v1 人工智能 机器学习

摘要

构建测试现代自然语言理解模型能力的基准十分困难——预训练语言模型利用基准中的伪特征达到人类水平,但在对抗样本上仍失败,并犯下暴露其缺乏常识的错误。本文提出将游戏化作为数据构建的框架。游戏中玩家的目标是构造能误导对手AI的问题,同时使用特定短语以获取额外分数。游戏环境提升了用户参与度,同时让游戏设计者能控制所收集的数据,从而能够大规模收集高质量数据。利用该方法我们创建了CommonsenseQA 2.0,包含14,343个是非题,并展示了其对于比游戏中使用的AI大数个数量级的模型而言的困难性。我们最佳的基线模型为基于T5的Unicorn(110亿参数),准确率达70.2%,在少样本推断设置下显著高于GPT-3(52.9%)。两者均远低于人类表现的94.1%。

关键词

引用

@article{arxiv.2201.05320,
  title  = {CommonsenseQA 2.0: Exposing the Limits of AI through Gamification},
  author = {Alon Talmor and Ori Yoran and Ronan Le Bras and Chandra Bhagavatula and Yoav Goldberg and Yejin Choi and Jonathan Berant},
  journal= {arXiv preprint arXiv:2201.05320},
  year   = {2022}
}

备注

Presented as Oral at NeurIPS 2021