代理记忆内部发生了什么?从涌现到诊断的电路分析
人工智能
2026-05-08 v2
摘要
代理记忆故障是无声的:基于大语言模型的代理即使未能在跨会话中提取、保留或检索所需信息,仍可产生流畅的响应。写入-管理-读取循环描述了这些系统的外部管道,但未说明哪些内部计算实现了每个阶段。我们在 Qwen-3 系列(0.6B--14B)和两种记忆框架(mem0 和 A-MEM)上追踪特征电路,报告了两项机械发现和一项可交付成果。第一,控制在内容之前即可被检测:路由电路在 0.6B 参数模型中即具有因果活性,而内容电路的信号仅在 4B 参数模型中可被检测,这暴露了一个部署 regime——小型模型在可靠提取或 grounding 底层事实之前,即可进行记忆决策路由。第二,共享枢纽被调用而非创建:写入和读取在已存在于基础模型中用作语境 grounding 基质的晚层枢纽上聚合,记忆框架在该基质上招募记忆特定功能方向,而非构建自己的枢纽。两项发现在 mem0 和 A-MEM 之间传递,表明底层计算是基础模型的属性,而非特定接口的属性。基于这些电路结构,我们开发了一种无监督的阶段级诊断工具,可将静默故障局部化至负责操作,准确率达 76.2%,显著优于最强监督基线的 13 分。这些结果表明,电路水平的签名可作为监控和结构导向代理记忆设计的实用工具。
引用
@article{arxiv.2605.03354,
title = {What Happens Inside Agent Memory? Circuit Analysis from Emergence to Diagnosis},
author = {Xutao Mao and Jinman Zhao and Gerald Penn and Cong Wang},
journal= {arXiv preprint arXiv:2605.03354},
year = {2026}
}