Prometheus Mind:为冻结语言模型加装记忆
人工智能
2026-01-26 v2
摘要
向预训练语言模型添加记忆通常需要架构更改或权重修改。我们提出了 Prometheus Mind,它使用 11 个模块化适配器(530MB,7% 开销)为冻结的 Qwen3-4B 加装记忆——通过移除适配器即可完全逆转。构建该系统需要解决四个问题:(1) 提取——我们开发了对比方向发现(CDD),无需标注数据即可通过最小对发现语义方向。(2) 训练——端到端优化会崩溃;在简单的代理任务上逐阶段训练每个适配器则能成功。(3) 注入——学习到的编码器无法泛化;我们发现 lm_head 权重行已经提供了我们所需的映射,无需训练。(4) 隐藏状态崩溃——transformer 使“wife”和“brother”的相似度达到 0.98+;我们训练投影以恢复区分度(0.98 0.09)。在 PrometheusExtract-132(132 个案例)上,该系统在干净输入上实现了 94.4% 的检索率(n=54,95% CI: [84.9%, 98.1%]),在带有省略、填充词或隐含主语的非正式输入上降至 19.4%(n=36)。主要瓶颈是关系分类(47.3% 准确率),导致了大多数提取错误。
引用
@article{arxiv.2601.15324,
title = {Prometheus Mind: Retrofitting Memory to Frozen Language Models},
author = {Mark Wind},
journal= {arXiv preprint arXiv:2601.15324},
year = {2026}
}
备注
28 pages, corrected some inconsistentsies and some edits