为何代理缓存失败以及如何修复:基于 Few-Shot 学习的结构意图标准化
计算与语言
2026-03-24 v2 人工智能
机器学习
摘要
个人 AI agent 通过重复调用 LLM 产生高额成本。我们指出现有缓存方法失败:GPTCache 在真实基准测试中达到 37.9% 的准确率;APC 达到 0-12%。根本原因是优化了错误的属性——缓存有效性需要 key 一致性和精确性,而非分类准确率。我们观察到 cache-key 评估可归约为 clustering 评估,并应用 V-measure 分解将这些在 n=8,682 个点上(跨 MASSIVE、BANKING77、CLINC150 和 NyayaBench v2)分离。我们引入 W5H2,一种结构意图分解框架。使用 SetFit 以每个 class 8 个示例,W5H2 在 MASSIVE 上实现 91.1%±1.7% 的准确率,用时约 2ms——而 GPTCache 为 37.9%,3,447ms 中的 20B 参数 LLM 为 68.8%。在 NyayaBench v2(20 个 class)上,SetFit 达到 55.3%,并实现 30 种语言的跨语言迁移。我们的五级级联处理 85% 的交互可本地化,项目实现 97.5% 的成本降低。我们通过 RCPS 提供九组 bound 的风险控制选择性预测保证。
引用
@article{arxiv.2602.18922,
title = {Why Agent Caching Fails and How to Fix It: Structured Intent Canonicalization with Few-Shot Learning},
author = {Abhinaba Basu},
journal= {arXiv preprint arXiv:2602.18922},
year = {2026}
}
备注
Added github repo and Hugging Face dataset link