中文

基于对话的大语言模型中的上下文干扰

人工智能 2023-09-25 v1 计算与语言

摘要

大语言模型(LLMs)因其令人印象深刻的能力和对世界的广博知识而对社会的巨大影响。各种应用和工具已被创建,允许用户在黑盒场景下与这些模型交互。然而,该场景的一个局限是用户无法修改模型的内部知识,而添加或修改内部知识的唯一方式是在当前交互中向模型显式提及。这一学习过程称为上下文训练,指的是局限于用户当前会话或上下文的训练。上下文学习具有重要应用,但也具有鲜有研究的局限。在本文中,我们展示了一项研究,表明模型可能遭受持续流入上下文的信息之间的干扰,导致其遗忘先前学习的知识,从而降低模型性能。在展示该问题的同时,我们提出了基于 bAbI 数据集的评测基准。

关键词

引用

@article{arxiv.2309.12727,
  title  = {In-context Interference in Chat-based Large Language Models},
  author = {Eric Nuertey Coleman and Julio Hurtado and Vincenzo Lomonaco},
  journal= {arXiv preprint arXiv:2309.12727},
  year   = {2023}
}