FLEX:统一小样本 NLP 评测
计算与语言
2021-11-09 v2 机器学习
摘要
小样本 NLP 研究非常活跃,但却在 disjoint 的研究脉络中进行,其评测套件缺乏具有挑战性且贴近现实的测试设置,且未采用严谨的实验设计。因此,学界既不知道哪些技术表现最佳,甚至不知道它们是否优于简单基线。为此,我们制定了 FLEX 原则,一套用于统一、严谨、有效且成本敏感的小样本 NLP 评测的要求与最佳实践。这些原则包括样本量设计(Sample Size Design),一种在保持评测成本可控的同时优化统计准确性与精度的基准设计新方法。遵循这些原则,我们发布了 FLEX 基准,其包含四种小样本迁移设置、零样本评测,以及涵盖多样 NLP 任务的公开排行榜。此外,我们提出 UniFew,一种基于提示的小样本学习模型,统一了预训练与微调的提示格式,摒弃了近期基于提示的方法在将下游任务格式适配语言模型预训练目标时所用的复杂机制。我们证明,尽管简单,UniFew 取得了与流行元学习和基于提示的方法相竞争的结果。
引用
@article{arxiv.2107.07170,
title = {FLEX: Unifying Evaluation for Few-Shot NLP},
author = {Jonathan Bragg and Arman Cohan and Kyle Lo and Iz Beltagy},
journal= {arXiv preprint arXiv:2107.07170},
year = {2021}
}
备注
NeurIPS 2021. First two authors contributed equally. Code and leaderboard available at: https://github.com/allenai/flex