中文

检查与编辑语言模型中的知识表示

计算与语言 2024-08-13 v3

摘要

神经语言模型(LM)表示由文本所描述的世界事实。有时这些事实源自训练数据(在大多数LM中,“banana”一词的表示编码了香蕉是水果这一事实)。有时事实源自输入文本本身(句子“I poured out the bottle”的表示编码了瓶子变空这一事实)。我们描述了REMEDI,一种学习将自然语言中的陈述映射到LM内部表示系统中的事实编码的方法。REMEDI编码可用作知识编辑器:当被加到LM隐藏表示上时,它们会修改下游生成以与新的事实保持一致。REMEDI编码也可用作探针:与LM表示比较时,它们揭示了LM已赋予所提及实体的哪些属性,在某些情况下可预测LM何时会生成与背景知识或输入文本相冲突的输出。因此,REMEDI将关于探针、提示和LM编辑的工作联系起来,并为细粒度检查与控制LM中知识的通用工具迈出了步伐。

关键词

引用

@article{arxiv.2304.00740,
  title  = {Inspecting and Editing Knowledge Representations in Language Models},
  author = {Evan Hernandez and Belinda Z. Li and Jacob Andreas},
  journal= {arXiv preprint arXiv:2304.00740},
  year   = {2024}
}

备注

Published in COLM 2024