中文

MemLoRA:面向设备端内存系统的专家适配器蒸馏

机器学习 2025-12-05 v1 计算与语言 计算机视觉与模式识别

摘要

记忆增强型大语言模型(LLM)通过存储相关记忆并将其作为上下文融入,展现了在长时间对话中的显著一致性。基于记忆的个性化在允许用户保持对话和数据隐私的设备端场景中同样关键。然而,记忆增强系统通常依赖成本过高的 LLM,难以在本地设备端部署。尽管小型语言模型(SLM)比 LLM 更适合设备端推理,但其性能不足。此外,这些基于 LLM 的系统缺乏原生视觉能力,限制了其在多模态场景中的应用。本文提出 (i) MemLoRA,一种通过为 SLM 配备专用记忆适配器来实现本地部署的新型记忆系统,以及 (ii) 其视觉扩展 MemLoRA-V,该系统将小型视觉语言模型(SVLM)集成到记忆系统中,实现原生视觉理解。遵循知识蒸馏原则,每个适配器针对特定的记忆操作——知识提取、记忆更新和记忆增强生成——分别进行训练。配备记忆适配器后,小型模型无需云端依赖即可实现精确的设备端记忆操作。在仅文本操作上,MemLoRA 在 LoCoMo 基准上优于 10× 更大的基线模型(如 Gemma2-27B),并达到与 60× 更大模型(如 GPT-OSS-120B)相当的性能。为评估视觉理解操作,我们以需要直接视觉推理的具有挑战性的视觉问答任务扩展了 LoCoMo。在该任务上,我们集成了 VLM 的 MemLoRA-V 相比基于标题的方法取得了显著提升(81.3 vs. 23.7 准确率),同时在文本任务上保持了强劲性能,证明了本方法在多模态场景中的有效性。

关键词

引用

@article{arxiv.2512.04763,
  title  = {MemLoRA: Distilling Expert Adapters for On-Device Memory Systems},
  author = {Massimo Bini and Ondrej Bohdal and Umberto Michieli and Zeynep Akata and Mete Ozay and Taha Ceritli},
  journal= {arXiv preprint arXiv:2512.04763},
  year   = {2025}
}