中文

BERTnesia:探究 BERT 中知识的捕获与遗忘

计算与语言 2021-09-09 v2

摘要

近来对复杂语言模型的探测揭示了所学表示中若干语言与语义模式。本文中,我们专门探测 BERT 以理解并度量其参数记忆中所捕获的关系知识。虽然语言理解探测通常应用于 BERT 所有层及微调模型,但事实知识方面尚未开展此类工作。我们利用已有的知识库补全任务(LAMA)探测预训练及微调 BERT 模型(排序、问答、NER)的每一层。我们的发现表明,知识并非仅存于 BERT 的最终层。中间层对总知识的贡献显著(17–60%)。探测中间层还揭示了不同类型知识以不同速率涌现。当 BERT 被微调时,关系知识会被遗忘。遗忘程度受微调目标与训练数据影响。我们发现排序模型遗忘最少,且其最终层比掩码语言建模和问答保留更多知识。然而,掩码语言建模从训练数据中获取新知识表现最佳。关于学习事实,我们发现容量与事实密度是关键因素。我们希望这一初步工作能推动对语言模型参数记忆及训练目标对事实知识影响的进一步研究。重复实验的代码已在 GitHub 公开。

关键词

引用

@article{arxiv.2106.02902,
  title  = {BERTnesia: Investigating the capture and forgetting of knowledge in BERT},
  author = {Jonas Wallat and Jaspreet Singh and Avishek Anand},
  journal= {arXiv preprint arXiv:2106.02902},
  year   = {2021}
}

备注

Extended journal version of arXiv:2010.09313. To be published