Larimar:具有情景记忆控制的大型语言模型
机器学习
2024-08-23 v4 人工智能
摘要
高效且准确地更新存储在大型语言模型(LLM)中的知识是当今最紧迫的研究挑战之一。本文提出了 Larimar——一种新颖的、受大脑启发的架构,旨在通过分布式情景记忆增强 LLM。Larimar 的记忆允许进行动态的、一次性的知识更新,而无需进行计算成本高昂的重新训练或微调。在多个事实编辑基准上的实验结果表明,即使在具有挑战性的顺序编辑设置下,Larimar 也能达到与最具竞争力的基线相当的准确率,并且在速度上表现出色——根据基础 LLM 的不同,实现了 8-10 倍的加速——同时由于所提出的架构简单、与 LLM 无关,因此具有通用性带来的灵活性。我们进一步为 Larimar 提供了选择性事实遗忘、防止信息泄露和输入上下文长度泛化的机制,并展示了它们的有效性。我们的代码可在 https://github.com/IBM/larimar 获取。
引用
@article{arxiv.2403.11901,
title = {Larimar: Large Language Models with Episodic Memory Control},
author = {Payel Das and Subhajit Chaudhury and Elliot Nelson and Igor Melnyk and Sarath Swaminathan and Sihui Dai and Aurélie Lozano and Georgios Kollias and Vijil Chenthamarakshan and Jiří and Navrátil and Soham Dan and Pin-Yu Chen},
journal= {arXiv preprint arXiv:2403.11901},
year = {2024}
}
备注
ICML 2024