中文

RET-LLM:面向大语言模型的通用读写记忆

计算与语言 2024-10-25 v2

摘要

大语言模型(LLMs)凭借其海量参数与全面的数据利用,显著推进了自然语言处理(NLP)领域的发展。然而,现有 LLMs 缺乏专用记忆单元,限制了其为各类任务显式存储与检索知识的能力。本文中,我们提出 RET-LLM,一种新颖框架,为 LLMs 配备通用写-读记忆单元,使其能根据任务需要从文本中抽取、存储并回忆知识。受 Davidson 语义理论启发,我们以三元组形式抽取并保存知识。该记忆单元被设计为可扩展、可聚合、可更新且可解释。通过定性评估,我们证明了所提框架在问答任务上优于基线方法。此外,我们的框架在处理基于时间问答任务时表现出稳健性能,展示了其有效管理时间依赖信息的能力。

关键词

引用

@article{arxiv.2305.14322,
  title  = {RET-LLM: Towards a General Read-Write Memory for Large Language Models},
  author = {Ali Modarressi and Ayyoob Imani and Mohsen Fayyaz and Hinrich Schütze},
  journal= {arXiv preprint arXiv:2305.14322},
  year   = {2024}
}

备注

NOTE: This concept paper outlines an initial methodology, now evolved and thoroughly evaluated in the MemLLM paper