中文

BERTnesia:探究 BERT 中知识的捕获与遗忘

计算与语言 2021-09-09 v2 机器学习

摘要

近期对复杂语言模型的探测揭示了所学表示中若干语言与语义模式的洞见。本文中,我们专门探测 BERT 以理解和度量其所捕获的关系知识。我们利用知识库补全任务来探测预训练及微调(排序、问答、NER)的 BERT 的每一层。我们的发现表明,知识并非仅包含于 BERT 的最终层。中间层对所得总知识的贡献显著(17–60%)。探测中间层还揭示了不同类型知识以不同速率涌现。当 BERT 被微调时,关系知识会被遗忘,但遗忘程度受微调目标影响,而不受数据集大小影响。我们发现排序模型遗忘最少,并在其最终层保留更多知识。我们在 github 上发布了代码以重复实验。

关键词

引用

@article{arxiv.2010.09313,
  title  = {BERTnesia: Investigating the capture and forgetting of knowledge in BERT},
  author = {Jonas Wallat and Jaspreet Singh and Avishek Anand},
  journal= {arXiv preprint arXiv:2010.09313},
  year   = {2021}
}

备注

BBNLP 2020, Edit: Small correction in the setup section, no changes to data or findings presented in the paper