中文

知识上下文:面向具备知识能力的半参数语言模型

计算与语言 2023-03-28 v3

摘要

全参数语言模型通常需要海量模型参数,以在零样本/少样本设定下存储解决多个自然语言任务所需的知识。此外,若不付出昂贵的模型重训练代价,难以适应不断演进的世界知识。本文提出一种新颖的半参数语言模型架构——知识上下文(KiC),它为参数化文本到文本语言模型赋予了知识丰富的外部记忆。具体而言,外部记忆包含六类知识:实体、词典、常识、事件、脚本与因果知识。对于每个输入实例,KiC模型自适应地选择一种知识类型并检索最有用的知识片段。输入实例及其知识增强被送入文本到文本模型(如T5)以生成输出答案,其中经提示后输入与输出均为自然语言形式。有趣的是,我们发现KiC可被视作一种特殊的混合专家(MoE)模型,其中知识选择器扮演路由角色,用于确定MoE中序列到专家的分配。这一关键观察启发我们开发一种新颖算法,通过实例自适应知识选择器训练KiC。作为一种知识丰富的半参数语言模型,KiC仅需小得多的参数部分即可在未见任务上取得优越的零样本性能。通过在40余个不同任务上的评估,我们表明参数量为770M的KiC_Large以大幅优势轻松超越规模大4至39倍的大型语言模型(LMs)。我们还证明,与全参数模型相比,KiC在远小得多的模型规模下即展现出涌现能力。

关键词

引用

@article{arxiv.2210.16433,
  title  = {Knowledge-in-Context: Towards Knowledgeable Semi-Parametric Language Models},
  author = {Xiaoman Pan and Wenlin Yao and Hongming Zhang and Dian Yu and Dong Yu and Jianshu Chen},
  journal= {arXiv preprint arXiv:2210.16433},
  year   = {2023}
}