中文

语言模型能从描述中学习新实体吗?注入知识传播中的挑战

计算与语言 2023-05-03 v1

摘要

预训练语言模型(LMs)被用于问答等知识密集型任务,但其知识随世界变化而持续过时。先前工作研究了针对 LMs 的有针对性更新,注入个别事实并评估模型是否学会这些事实同时不改变其他上下文上的预测。我们向前推进一步,研究 LMs 基于注入事实进行推断(或传播这些事实)的能力:例如,在得知某物是一部电视剧后,LM 是否会预测你可以观看它?我们用两个完形填空式任务来研究这一点:一个现有的关于新实体的真实世界句子数据集(ECBD),以及一个新设计的受控基准,包含需要不同层次注入知识推断的手动设计模板。令人惊讶的是,我们发现现有的知识更新方法(基于梯度的微调及其改进)几乎不展现注入知识的传播。这些方法仅当注入事实与目标推断之间存在词汇重叠时才提升完形填空实例上的表现。然而,在 LM 上下文中前置实体定义在所有设定下均提升表现,表明参数更新式知识注入方法仍有大量提升空间。

关键词

引用

@article{arxiv.2305.01651,
  title  = {Can LMs Learn New Entities from Descriptions? Challenges in Propagating Injected Knowledge},
  author = {Yasumasa Onoe and Michael J. Q. Zhang and Shankar Padmanabhan and Greg Durrett and Eunsol Choi},
  journal= {arXiv preprint arXiv:2305.01651},
  year   = {2023}
}

备注

ACL 2023