中文

扰动样本揭示语言模型共享的不变性

计算与语言 2024-06-18 v2 机器学习

摘要

自然语言处理(NLP)研究的快速增长导致了众多新模型的出现,超出了我们对它们与已有模型如何比较的理解。造成这一困难的一个主要原因是基准饱和,其可能无法很好地反映模型在真实场景中的性能差异。在这项工作中,我们引入了一种新颖框架,通过揭示两个 NLP 模型对针对特定语言能力的可解释输入扰动的共享不变性来比较它们。通过对来自相同和不同架构家族的模型进行实验,该框架提供了关于模型变化(例如蒸馏、规模增大)如何影响语言能力的见解。此外,我们的框架能够评估商业黑盒模型(例如 InstructGPT 家族)与更易理解的模型(例如 GPT-2)之间的不变性。在跨实验中,我们观察到大型语言模型共享由不同规模模型编码的许多不变性,而大型模型的不变性仅由其他大型模型共享。拥有广泛种类的不变性可能是大型语言模型近期成功的关键,我们的框架可以阐明新模型中保留或涌现的不变性类型。我们公开了代码。

关键词

引用

@article{arxiv.2311.04166,
  title  = {Perturbed examples reveal invariances shared by language models},
  author = {Ruchit Rawal and Mariya Toneva},
  journal= {arXiv preprint arXiv:2311.04166},
  year   = {2024}
}

备注

Accepted at ACL 2024 (Findings)