中文

将探针作为归纳偏置的量化

计算与语言 2022-03-28 v2

摘要

预训练上下文表示已在一系列下游任务上带来显著的性能提升。此类性能提升促使研究者量化和理解这些表示中所编码的语言信息。一般而言,研究者通过探针(probing)来量化语言信息的数量,该工作包括训练一个监督模型以直接从上下文表示中预测语言属性。遗憾的是,这一探针定义已在文献中受到广泛批评,并被观察到会导致矛盾和反直觉的结果。在本文的理论部分,我们主张探针的目标应当是度量表示在特定任务上编码的归纳偏置(inductive bias)量。我们进一步描述了一个贝叶斯框架,该框架将这一目标操作化并允许我们量化表示的归纳偏置。在本文的实证部分,我们将该框架应用于多种 NLP 任务。我们的结果表明,我们所提出的框架缓解了探针中发现的许多先前问题。此外,我们能够给出具体证据:对于某些任务,fastText 可以提供比 BERT 更好的归纳偏置。

关键词

引用

@article{arxiv.2110.08388,
  title  = {Probing as Quantifying Inductive Bias},
  author = {Alexander Immer and Lucas Torroba Hennigen and Vincent Fortuin and Ryan Cotterell},
  journal= {arXiv preprint arXiv:2110.08388},
  year   = {2022}
}

备注

ACL 2022