中文

保持还是遗忘?深入探究语言模型的知识记忆机制

计算与语言 2024-03-14 v2 人工智能

摘要

记忆是最基本的认知功能之一,充当世界知识与活动事件的存储库。近年来,大规模预训练语言模型展现出显著的记忆能力。相反,长期以来人们观察到未经预训练的朴素神经网络饱受灾难性遗忘问题的困扰。为探究这种保持-遗忘的矛盾并理解语言模型的记忆机制,我们通过控制目标知识类型、学习策略与学习进度进行了详尽的实验。我们发现:1) 朴素语言模型是易遗忘的;2) 预训练导致具有保持能力的语言模型;3) 知识相关性与多样化显著影响着记忆的形成。这些结论有助于理解预训练语言模型的能力,并为设计和评估语言模型新的学习与推理算法提供启示。

关键词

引用

@article{arxiv.2305.09144,
  title  = {Retentive or Forgetful? Diving into the Knowledge Memorizing Mechanism of Language Models},
  author = {Boxi Cao and Qiaoyu Tang and Hongyu Lin and Shanshan Jiang and Bin Dong and Xianpei Han and Jiawei Chen and Tianshu Wang and Le Sun},
  journal= {arXiv preprint arXiv:2305.09144},
  year   = {2024}
}

备注

Accepted by LREC-COLING 2024