TRELM:面向知识增强语言模型的鲁棒高效预训练
计算与语言
2024-03-19 v1
摘要
KEPLMs 是利用外部知识来增强语言理解的预训练模型。以往的语言模型通过引入从知识图谱中的关系三元组学习到的与知识相关的预训练任务,来促进知识获取。然而,这些模型并未优先学习与实体相关 token 的嵌入。此外,更新 KEPLMs 中的全部参数在计算上要求很高。本文提出了 TRELM,一个面向知识增强语言模型的鲁棒高效预训练框架。我们观察到,文本语料库中的实体通常遵循长尾分布,其中部分实体的表示未得到最优优化,从而阻碍了 KEPLMs 的预训练过程。为了解决这个问题,我们采用鲁棒的方法注入知识三元组,并利用知识增强记忆库来捕获有价值的信息。此外,更新前馈网络(FFNs)中存储事实知识的一小部分神经元既足够又高效。具体而言,我们利用动态知识路由来识别 FFNs 中的知识路径,并在预训练期间选择性地更新参数。实验结果表明,TRELM 将预训练时间减少了至少 50%,并且在知识探测任务和多个知识感知语言理解任务中优于其他 KEPLMs。
引用
@article{arxiv.2403.11203,
title = {TRELM: Towards Robust and Efficient Pre-training for Knowledge-Enhanced Language Models},
author = {Junbing Yan and Chengyu Wang and Taolin Zhang and Xiaofeng He and Jun Huang and Longtao Huang and Hui Xue and Wei Zhang},
journal= {arXiv preprint arXiv:2403.11203},
year = {2024}
}