中文

Aeon:面向长周期 LLM 智能体的高性能神经符号内存管理

人工智能 2026-02-18 v3

摘要

大型语言模型(LLM)从根本上受限于自注意力的二次方计算成本以及“迷失在中间”现象,即推理能力随着上下文窗口的扩大而退化。现有解决方案主要依赖于向量数据库的“扁平 RAG”架构,将内存视为非结构化的嵌入集合,无法捕捉长周期交互的层次结构和时间结构。本文提出了 Aeon,一种将内存重新定义为受管操作系统资源的神经符号认知操作系统。Aeon 将内存结构化为记忆宫殿(通过 SIMD 加速的页簇向量索引 Atlas 实现的空间索引)和轨迹(一种神经符号情景图)。该架构引入了三项进展:(1)对称 INT8 标量量化,通过 NEON SDOT 内联函数实现 3.1 倍的空间压缩和 5.6 倍的数学加速;(2)解耦的预写式日志(WAL),确保崩溃可恢复性且统计开销可忽略不计(<1%);以及(3)Sidecar Blob 竞技场,通过具有分代垃圾回收的仅追加 mmap 支持的 blob 文件,消除了先前 440 个字符的文本上限。语义旁视缓冲区(SLB)利用会话局部性实现了低于 5us 的检索延迟,并在缓存插入时将 INT8 向量反量化为 FP32,以保持 L1 驻留查找性能。在 Apple M4 Max 上的基准测试表明,该组合架构实现了 4.70ns 的 INT8 点积延迟,10 万个节点下 3.09us 的树遍历速度(比 FP32 快 3.4 倍),并通过基于周期的内存回收在恶劣的 16 线程竞争下实现了 750ns 的 P99 读取延迟。

关键词

引用

@article{arxiv.2601.15311,
  title  = {Aeon: High-Performance Neuro-Symbolic Memory Management for Long-Horizon LLM Agents},
  author = {Mustafa Arslan},
  journal= {arXiv preprint arXiv:2601.15311},
  year   = {2026}
}

备注

v3: Production hardening. Added INT8 quantization (5.6x dot product speedup, 3.1x compression), crash recovery via decoupled WAL (<1% overhead), unlimited text storage via sidecar blob arena with generational GC, and epoch-based reclamation for lock-free reads (P99 750ns under 16-thread contention). Revised for systems engineering clarity