洞察生成器:为 LLM 智能体系统化语料库级跟踪诊断
人工智能
2026-05-22 v2 机器学习
软件工程
摘要
诊断 LLM 智能体的工作仍主要是手动完成的。实践者检查执行跟踪的小子集,形成 ad-hoc 假设并迭代。此过程遗漏了仅在跟踪 population 中才会出现的模式,且无法扩展到 individual traces 跨越数万 token 的生产语料库。我们形式化了语料库级跟踪诊断的问题。给定一组执行跟踪的语料库,目标是产生能够 characterize 跨跟踪组的系统性行为模式的 grounded 自然语言洞察,并链接到支持证据。我们提出了洞察生成器(IG),一个多智能体系统,通过在跟踪语料库中提出并测试假设来回答诊断问题,从而产生 evidence-backed 洞察报告。我们在定性和客观维度上评估了 IG,涵盖基于评分标准的报告评估以及通过实施 IG 洞察实现的下游性能改进。使用 IG 报告的专家在 scaffold performance 上比未修改的基线 scaffold 提升 30.4pp,而利用 IG 洞察开发的编码智能体表现出一致且稳定的收益。在基准测试中,IG 的 scout-investigator 架构在 detection coverage 上产生的发现与竞争方法相当,而领域专家认为 IG 报告在 depth 和 evidence quality 上领先。
引用
@article{arxiv.2605.21347,
title = {Insights Generator: Systematic Corpus-Level Trace Diagnostics for LLM Agents},
author = {Akshay Manglik and Apaar Shanker and Kaustubh Deshpande and Jason Qin and Yash Maurya and Veronica Chatrath and Vijay S. Kalmath and Levi Lentz and Yuan and Xue},
journal= {arXiv preprint arXiv:2605.21347},
year = {2026}
}