中文

PeopleSearchBench:评估 AI 驱动的人物搜索平台的多维基准测试

人工智能 2026-03-31 v1 机器学习

摘要

AI 驱动的人物搜索平台正日益应用于招聘、销售前景挖掘和职业社交网络,但尚无广泛接受的评估其性能的基准测试。我们引入了 PeopleSearchBench,这是一个开源基准测试,在四个用例上比较了四个人物搜索平台:企业招聘、B2B 销售前景挖掘、具有确定性答案的专家搜索以及影响者/KOL 发现。一项关键贡献是基于标准的验证(Criteria-Grounded Verification),这是一个事实相关性流水线,从每个查询中提取明确、可验证的标准,并利用实时网络搜索判断返回的人物是否满足这些标准。这产生了基于事实验证而非主观整体 LLM-as-judge 评分的二元相关性判断。我们在三个维度上评估系统:相关性精确度(padded nDCG@10)、有效覆盖率(任务完成率和合格结果产出率)以及信息效用(资料完整性和有用性),三者等权平均得到总分。专用 AI 人物搜索智能体 Lessie 表现最佳,总分 65.2,比第二名系统高 18.5%,并且是唯一在所有 119 个查询上实现 100% 任务完成的系统。我们还报告了置信区间、对验证流水线的人工验证(Cohen's kappa = 0.84)、消融实验以及查询、提示和归一化程序的完整文档。代码、查询定义和汇总结果可在 GitHub 上获取。

关键词

引用

@article{arxiv.2603.27476,
  title  = {PeopleSearchBench: A Multi-Dimensional Benchmark for Evaluating AI-Powered People Search Platforms},
  author = {Wei Wang and Tianyu Shi and Shuai Zhang and Boyang Xia and Zequn Xie and Chenyu Zeng and Qi Zhang and Lynn Ai and Yaqi Yu and Kaiming Zhang and Feiyue Tang},
  journal= {arXiv preprint arXiv:2603.27476},
  year   = {2026}
}

备注

25 pages