面向智能体的查询引擎
人工智能
2026-05-28 v1 数据库
摘要
当今生产环境中增长最快的数据是非结构化文本:智能体轨迹、聊天日志、推理链、模型输出。人们想要分析这些数据,而有价值的问题(“显示智能体在哪里感到困惑”)无法仅通过SQL回答,因为如果没有模型参与查询路径,文本是不可查询的。这种分析自然发生的地方是新型AI应用(Claude Code、Cursor、Claude Desktop、浏览器内智能体),它们在客户端运行,并在同一进程中同时托管人类用户和LLM智能体。这些应用越来越希望处理数据,但数据湖仓的读取路径在JS运行时中难以使用:Spark、Trino和托管数据仓库不适合那里。为了构建这种新型AI数据应用,引擎的三个属性成为首要考虑:一个JS原生分发版,能够直接嵌入应用已运行的运行时;一个足够小的包,可以放入冷标签页或每轮智能体沙箱中;以及一种将分析算子与基于模型的文本解释交错执行的方法。我们提出了Hyperparam,三个开源的JavaScript库(Hyparquet、Squirreling、Icebird),总计小于70 KB,它们直接从对象存储读取Parquet和Apache Iceberg,并通过基于单元格的、异步原生的SQL执行来满足第三个属性,因此昂贵的单元格仅在下游算子需要时才触发。Squirreling在过滤受限查询上运行LLM形状的异步UDF,速度比DuckDB-WASM快300倍以上(在排序受限查询上快192倍),并以低三分之二的成本完成了一个十任务智能体分析师套件。我们认为,数据工程作为一个学科需要为现已投入生产的AI原生客户端应用以及与其用户协同工作的智能体进行更新。
引用
@article{arxiv.2605.27785,
title = {A Query Engine for the Agents},
author = {Kenny Daniel},
journal= {arXiv preprint arXiv:2605.27785},
year = {2026}
}
备注
4 pages, 1 figure, 3 tables