中文

用 500 个任务量化预训练语言模型的自适应性

计算与语言 2022-05-06 v2 机器学习

摘要

当一个神经语言模型(LM)被适配以执行一项新任务时,该任务的哪些方面能预测模型的最终性能?在自然语言处理(NLP)中,LM 对单个样本泛化能力的系统性特征已得到充分刻画,但 LM 对新任务自适应性的系统性方面却远未被充分理解。我们提出了一项关于 LM 自适应性特征与局限的大规模实证研究,使用了一个新基准 TaskBench500,其由 500 个程序化生成的序列建模任务构建而成。这些任务结合了语言处理的核心方面,包括词汇语义、序列处理、记忆、逻辑推理和常识知识。利用 TaskBench500,我们评估了自适应性的三个方面,发现:(1)不同适配过程在记忆小数据集的能力上差异显著;(2)在一部分任务类型中,适配过程对复杂任务表现出组合式自适应性;(3)未能匹配训练标签分布可由预测单个标签的内在难度不匹配来解释。我们的实验表明,对新任务的自适应性如同对新样本的泛化能力一样,可以被系统性地描述和理解,并以对可利用该新基准研究的自适应性其他方面的讨论作结。

关键词

引用

@article{arxiv.2112.03204,
  title  = {Quantifying Adaptability in Pre-trained Language Models with 500 Tasks},
  author = {Belinda Z. Li and Jane Yu and Madian Khabsa and Luke Zettlemoyer and Alon Halevy and Jacob Andreas},
  journal= {arXiv preprint arXiv:2112.03204},
  year   = {2022}
}

备注

NAACL 2022; 20 pages, 6 figures, 8 tables