VibeSearchBench:面向真实场景的长期主动搜索基准
计算与语言
2026-05-28 v1 人工智能
摘要
基于大语言模型的智能体在搜索基准测试中表现良好,但真实用户却持续感到结果不尽人意,这揭示了评估与体验之间持续存在的差距。我们将这一差距归因于现有基准测试依赖于过度指定的查询、单轮交互以及固定模式的评估,这些都无法反映用户与智能体通过多轮对话协作细化模糊意图的真实搜索行为。我们将这种范式称为VibeSearch,并引入VibeSearchBench,这是一个包含200个跨20个领域的人工策划双语(中文和英文)任务的基准,分为VibeSearch-Pro(专业)和VibeSearch-Daily(日常生活)子集。每个任务将一个用户角色与一个无模式的事实知识图谱配对,并通过一个渐进式披露的用户模拟器和一个图匹配评估框架进行评估。我们在ReAct框架和OpenClaw智能体工具包下对七个前沿模型进行了基准测试。结果表明,所有模型在VibeSearch任务上仍然严重不足(最佳F1分数:30.30),凸显了在长上下文推理、主动意图激发和结构化知识构建方面需要取得根本性进展。
引用
@article{arxiv.2605.27882,
title = {VibeSearchBench: Benchmarking Long-horizon Proactive Search in the Wild},
author = {Xiaohongshu Inc},
journal= {arXiv preprint arXiv:2605.27882},
year = {2026}
}