中文

掩码策略对语言模型知识保留的影响

计算与语言 2023-06-13 v1

摘要

语言模型从其预训练阶段保留了大量的世界知识。这使得具备知识的模型能够应用于信息检索中普遍存在的知识密集型任务,例如排序或问答。理解我们的模型如何以及获取了哪些事实信息,对于构建负责任的模型是必要的。然而,关于预训练任务对语言模型在预训练期间捕获和遗忘的知识量的影响,已有研究十分有限。建立对知识获取的更好理解是本文的目标。因此,我们利用一组预训练任务将知识注入我们的模型。在后续步骤中,我们通过测量模型回答事实性问题的能力来测试其知识保留情况。我们的实验表明,相比于掩码随机词元,掩码实体以及基于点互信息对有相关性的片段进行原则性掩码会导致更多事实知识被保留。我们的发现表明,如同执行任务的能力一样,从训练该任务中获得的事实知识在模型被训练去执行另一任务时会被遗忘(灾难性遗忘),以及如何防止这一现象。为促进可复现性,本文使用的代码与数据均已公开可用。

关键词

引用

@article{arxiv.2306.07185,
  title  = {The Effect of Masking Strategies on Knowledge Retention by Language Models},
  author = {Jonas Wallat and Tianyi Zhang and Avishek Anand},
  journal= {arXiv preprint arXiv:2306.07185},
  year   = {2023}
}

备注

6 pages ACL format