中文

具有摊销上下文记忆的语言模型在线自适应

机器学习 2024-11-05 v2 计算与语言

摘要

由于信息的快速生成和传播,大型语言模型(LLM)尽管开发成本巨大,却很快过时。为满足保持模型更新的关键需求,在线学习已成为在现实世界应用中利用 LLM 的重要工具。然而,鉴于未见文档语料库的不断扩展和现代 LLM 庞大的参数空间,高效的自适应至关重要。为应对这些挑战,我们提出了摊销上下文记忆(MAC),这是一个高效且有效的 LLM 在线自适应框架,具有强大的知识保留能力。我们提出了一种特征提取和记忆增强方法,将从新文档中提取的信息压缩并提取为存储在记忆库中的紧凑调制。在回答问题时,我们的模型会关注并从该记忆库中提取相关知识。为了以高效的方式学习信息丰富的调制,我们利用基于摊销的元学习,用编码器的单次前向传播替代了原本需要的优化过程。随后,我们通过学习根据问题选择和聚合并选定的文档为单一调制,使我们能够在测试期间自适应冻结的语言模型,而无需进一步的梯度更新。我们的实验证明了 MAC 在多个方面的优越性,包括在线自适应性能、时间和内存效率。此外,我们展示了 MAC 如何与检索增强生成(RAG)等流行替代方案结合并提高其性能。代码地址:https://github.com/jihoontack/MAC。

关键词

引用

@article{arxiv.2403.04317,
  title  = {Online Adaptation of Language Models with a Memory of Amortized Contexts},
  author = {Jihoon Tack and Jaehyung Kim and Eric Mitchell and Jinwoo Shin and Yee Whye Teh and Jonathan Richard Schwarz},
  journal= {arXiv preprint arXiv:2403.04317},
  year   = {2024}
}

备注

Published as a conference proceeding for NeurIPS 2024