SemanticALLI:在智能体系统中缓存推理,而不仅仅是响应
人工智能
2026-02-03 v2 多智能体系统
摘要
智能体 AI 流水线存在隐性效率问题:即便用户的自然语言表述全新,系统仍频繁重建相同的中间逻辑,如指标标准化或图表脚手架。传统的边界缓存无法捕获这种 inefficiency,因为它将推理过程视为单一的黑盒子。我们引入 SemanticALLI,这是一种嵌入于 Alli(PMG 市场智能平台)中的 pipeline-aware 架构,旨在实现冗余推理。通过将生成过程分解为分析意图解析(AIR)和可视化合成(VS),SemanticALLI 将结构化中间表示(IR)提升为一等可缓存实体。评估结果显示,基线单体化缓存仅达到 38.7% 的命中率,受语言变异的限制;而我们的方法通过引入可视化合成阶段,实现了 83.10% 的命中率,绕过了 4023 次 LLM 调用,平均延迟仅为 2.66 毫秒。这种内部复用显著降低了总 token 消耗,为 AI 系统设计提供了一条实用经验:即便用户极少自我重复,流水线本身也常在稳定的结构化检查点处重复,从而实现可靠的缓存。
引用
@article{arxiv.2601.16286,
title = {SemanticALLI: Caching Reasoning, Not Just Responses, in Agentic Systems},
author = {Varun Chillara and Dylan Kline and Christopher Alvares and Evan Wooten and Huan Yang and Shlok Khetan and Cade Bauer and Tré Guillory and Tanishka Shah and Yashodhara Dhariwal and Volodymyr Pavlov and George Popstefanov},
journal= {arXiv preprint arXiv:2601.16286},
year = {2026}
}