LocalSearchBench:真实世界本地生活服务中的智能体搜索基准测试
人工智能
2026-01-14 v2
摘要
大型推理模型(LRMs)的最新进展使智能体搜索系统能够在多个来源上执行复杂的多步推理。然而,大多数研究聚焦于通用信息检索,很少探索具有独特挑战的垂直领域。在这项工作中,我们聚焦于本地生活服务,并引入了LocalSearchBench,它涵盖了多样且复杂的业务场景。该领域的真实查询通常具有模糊性,需要在商家和产品之间进行多跳推理,仍然具有挑战性且尚未完全解决。作为本地生活服务中智能体搜索的首个全面基准,LocalSearchBench包含一个跨越6个服务类别和9个主要城市的超过130万条商家条目数据库,以及来自真实用户查询的900个需要多步推理的多跳QA任务。我们还开发了LocalPlayground,一个集成多种工具供LRMs交互的统一环境。实验表明,即使是最先进的大型推理模型在LocalSearchBench上也表现不佳:最佳模型(DeepSeek-V3.2)仅达到35.60%的正确率,大多数模型在完整性(平均60.32%)和忠实度(平均30.72%)方面存在问题。这凸显了专用基准和本地生活服务领域特定智能体训练的必要性。代码、基准和排行榜可在https://localsearchbench.github.io/获取。
引用
@article{arxiv.2512.07436,
title = {LocalSearchBench: Benchmarking Agentic Search in Real-World Local Life Services},
author = {Hang He and Chuhuai Yue and Chengqi Dong and Mingxue Tian and Hao Chen and Zhenfeng Liu and Jiajun Chai and Xiaohan Wang and Yufei Zhang and Qun Liao and Guojun Yin and Wei Lin and Chengcheng Wan and Haiying Sun and Ting Su},
journal= {arXiv preprint arXiv:2512.07436},
year = {2026}
}