面向问答任务的知识注入课程预训练框架
计算与语言
2024-03-18 v1 人工智能
摘要
知识基准问答 (Knowledge-based question answering, KBQA) 是自然语言处理研究中的关键任务,也是访问 web 数据和知识的一种方法,要求利用知识图谱 (KG) 进行推理。在已有文献中,一种可行方案是将预训练语言模型 (LM) 与 KG 结合,通过生成 KG 中心的预训练语料,这一方法已显示出优势。然而,这些方法往往依赖特定技术和资源才能发挥作用,这可能并非总是可用且限制了其应用。此外,现有方法更关注通过 KG 改进语言理解,而忽略了更重要的人类式复杂推理。为此,本文提出一种通用的知识注入课程预训练框架 (Knowledge-Injected Curriculum Pretraining, KICP),以实现 KBQA 任务中 KG 的全面学习与利用,该框架由知识注入 (KI)、知识适应 (KA) 和课程推理 (CR) 组成。具体而言,KI 模块通过生成 KG 中心的预训练语料将知识注入 LM,并将过程概括为可与不同实现方式兼容的三个关键步骤。随后,KA 模块通过配备适配器的 LM 来学习生成的语料中的知识,同时保持其原始的自然语言理解能力,以减少生成语料与自然语料之间差异带来的负面影响。最后,为使 LM 具备复杂推理能力,CR 模块遵循人类推理模式构建三个推理难度递增的语料,并以课程方式从易到难训练 LM。我们提供该通用框架的一个实现,并在四个真实世界数据集上对提出的 KICP 进行评估。结果表明,该框架能够实现更好的性能。
引用
@article{arxiv.2403.09712,
title = {A Knowledge-Injected Curriculum Pretraining Framework for Question Answering},
author = {Xin Lin and Tianhuang Su and Zhenya Huang and Shangzi Xue and Haifeng Liu and Enhong Chen},
journal= {arXiv preprint arXiv:2403.09712},
year = {2024}
}
备注
Accepted by WWW 2024