Kformer:在 Transformer 前馈层中注入知识
计算与语言
2023-01-26 v2 人工智能
数据库
信息检索
机器学习
摘要
近来出现了多种面向预训练语言模型(PTMs)的知识注入模型;然而,多数先前研究忽视了 PTM 自身凭借参数中存储的大量隐式知识所具有的能力。近期一项研究在 Feed Forward Network(FFN)中观测到知识神经元,其负责表达事实性知识。本工作中,我们提出一个简单模型 Kformer,它通过 Transformer FFN 层中的知识注入,利用 PTM 中存储的知识与外部知识。在两项知识密集型任务(常识推理即 SocialIQA,以及医学问答即 MedQA-USMLE)上的实证结果表明,Kformer 优于其他知识注入技术(如拼接或基于注意力的注入)。我们认为所提简单模型与实证发现或有助于社区开发更强大的知识注入方法。代码见 https://github.com/zjunlp/Kformer。
引用
@article{arxiv.2201.05742,
title = {Kformer: Knowledge Injection in Transformer Feed-Forward Layers},
author = {Yunzhi Yao and Shaohan Huang and Li Dong and Furu Wei and Huajun Chen and Ningyu Zhang},
journal= {arXiv preprint arXiv:2201.05742},
year = {2023}
}
备注
Accepted by NLPCC 2022