中文

我的知识增强语言模型中增强了什么?

计算与语言 2022-11-17 v7 信息论 机器学习 math.IT

摘要

预训练语言模型(LM)对事实知识的捕捉并不好。这催生了多种知识集成(KI)方法,旨在将外部知识融入预训练 LM。尽管 KI 方法相较原始 LM 显示出一定性能提升,这些方法的内部机制仍未被充分理解。例如,尚不清楚此类模型以何种方式、何种知识被有效整合,以及这种整合是否会导致对已学知识的灾难性遗忘。本文以信息论视角重新审视这些模型中的 KI 过程,并表明 KI 可用图卷积操作来解释。我们提出一种称为图卷积模拟器(Graph Convolution Simulator, GCS)的探针模型,用于解释知识增强 LM 并揭示何种知识被整合进这些模型。我们进行实验验证所提 GCS 确实可用于正确解释 KI 过程,并用它分析两个知名的知识增强 LM:ERNIE 与 K-Adapter,发现其中仅整合了少量事实知识。我们按多种关系类型对知识分层,发现 ERNIE 与 K-Adapter 对不同种类知识的整合程度各异。我们的分析还表明,单纯增大 KI 语料规模未必带来更好的 KI;可能需要基础性进展。

关键词

引用

@article{arxiv.2202.00964,
  title  = {What Has Been Enhanced in my Knowledge-Enhanced Language Model?},
  author = {Yifan Hou and Guoji Fu and Mrinmaya Sachan},
  journal= {arXiv preprint arXiv:2202.00964},
  year   = {2022}
}

备注

Our code, demo, and instructions of the usage can be found in https://github.com/yifan-h/GCS_KI