RAINBOW 上的 UNICORN:基于新多任务基准的通用常识推理模型
计算与语言
2021-03-25 v1
摘要
常识 AI 长期以来被视为近乎不可能的目标——直到最近。如今,随着大量新基准与模型的涌入,研究兴趣急剧增长。我们提出评估常识模型的两种新方法,强调其在新任务上的通用性并建立在多样化且近期引入的基准之上。首先,我们提出一个新的多任务基准 RAINBOW,以促进在多个任务和数据集上泛化良好的常识模型研究。其次,我们提出一种新颖的评估方法——代价等价曲线,它揭示了源数据集、预训练语言模型和迁移学习方法的选择如何影响性能与数据效率的新见解。我们进行了大量实验——涵盖 4800 个模型、超过 200 次实验——并报告了多个有价值且有时令人惊讶的发现,例如:若遵循特定方案,迁移几乎总是带来更好或相当的性能;基于 QA 的常识数据集彼此间迁移良好,而常识知识图谱则不然;以及或许反直觉地,较大模型比较小模型从迁移中获益更多。最后但并非最不重要,我们引入了一种新的通用常识推理模型 UNICORN,它在 8 个流行常识基准上确立了新的 SOTA 性能:aNLI(87.3%)、CosmosQA(91.8%)、HellaSWAG(93.9%)、PIQA(90.1%)、SocialIQa(83.2%)、WinoGrande(86.6%)、CycIC(94.0%)和 CommonsenseQA(79.3%)。
引用
@article{arxiv.2103.13009,
title = {UNICORN on RAINBOW: A Universal Commonsense Reasoning Model on a New Multitask Benchmark},
author = {Nicholas Lourie and Ronan Le Bras and Chandra Bhagavatula and Yejin Choi},
journal= {arXiv preprint arXiv:2103.13009},
year = {2021}
}
备注
27 pages, 19 figures, 34 tables. Accepted to AAAI 2021. For associated code and data see https://github.com/allenai/rainbow