中文

Look It Up:分析现代大语言模型内部 Web 搜索能力

计算与语言 2025-11-25 v1 人工智能

摘要

现代大型语言模型集成了 Web 搜索功能以提供实时答案,但是否高效地在实际需要时进行校准仍不明确。我们引入了一个基准测试,用于评估商业模型在无需访问内部状态或参数的前提下,Web 访问的必要性与有效性。该数据集包括 783 个静态问题的分割,这些问题在截止日期前可被答案获取,用于测试模型是否基于低内部置信度调用搜索;以及 288 个动态后截止查询的分割,用于测试模型是否识别搜索的必要性并检索更新信息。Web 访问在 GPT-5-mini 和 Claude Haiku 4.5 的静态准确率上显著提升,但置信度校准恶化。在动态查询方面,两者经常调用搜索,但由于查询表达较弱,准确率仍低于 70%。每次提高准确率的调用成本仍较低,但一旦初始检索失败,收益便会下降。选择性调用有所帮助,但模型在搜索后变得过于自信且不一致。总体而言,内置 Web 搜索在提升事实准确性方面具有意义作用且可被选择性调用,但模型仍显得过于自信、忽略了必要的检索步骤,并且在初始搜索查询表现不佳时会受挫。综上所述,内置 Web 搜索更适合作为低延迟验证层,而非可靠的分析工具,仍有明确的改进空间。

关键词

引用

@article{arxiv.2511.18931,
  title  = {Look It Up: Analysing Internal Web Search Capabilities of Modern LLMs},
  author = {Sahil Kale},
  journal= {arXiv preprint arXiv:2511.18931},
  year   = {2025}
}

备注

10 pages, 8 figures