Haystack 工程:面向异构性和智能体的长上下文评估的上下文工程
计算与语言
2025-10-13 v2 人工智能
信息检索
摘要
现代长上下文大型语言模型(LLM)在合成的“针对 haystack 的针探”(NIAH)基准测试中表现良好,但此类测试忽略了噪声上下文如何源自偏导检索和智能体工作流程。我们认为,必须进行 haystack 工程,以构建能忠实再现关键现实因素——来自异构性偏导检索器和智能体工作流程中级联错误——的噪声长上下文,以测试模型的长上下文鲁棒性。我们通过在完整英文维基百科超链接网络上构建的 HaystackCraft 实现了这一点,这是一个新的 NIAH 基准测试,包含多跳问题。HaystackCraft 评估了异构检索策略(例如稀疏检索、稠密检索、混合检索和图基检索)如何影响干扰项组成、haystack 排序以及下游 LLM 性能。HaystackCraft 进一步扩展了 NIAH 到动态、LLM 依赖的设置,模拟智能体操作,其中模型细化查询、反思其过去的推理,并决定何时停止。15 种长上下文模型的实验显示:(1)虽然更强的稠密检索器可以引入更具挑战性的干扰项,图基重新排序同时提高检索效果并减轻更有害的干扰项;(2)在智能体测试中,即使是 Gemini 2.5 Pro 和 GPT-5 等高级模型,也会因自生成的干扰项而出现级联失败,或在执行早期停止方面受限。这些结果凸显了智能体长上下文推理中的持久挑战,并将 HaystackCraft 确立为未来进步的有价值测试平台。
引用
@article{arxiv.2510.07414,
title = {Haystack Engineering: Context Engineering for Heterogeneous and Agentic Long-Context Evaluation},
author = {Mufei Li and Dongqi Fu and Limei Wang and Si Zhang and Hanqing Zeng and Kaan Sancak and Ruizhong Qiu and Haoyu Wang and Xiaoxin He and Xavier Bresson and Yinglong Xia and Chonglin Sun and Pan Li},
journal= {arXiv preprint arXiv:2510.07414},
year = {2025}
}
备注
Code available at https://github.com/Graph-COM/HaystackCraft