中文

基于大语言模型的搜索引擎与传统搜索引擎中的源覆盖与引用偏差

计算与语言 2025-12-11 v1 计算机与社会

摘要

基于大语言模型的搜索引擎(LLM-SEs)引入了信息检索的新范式。与传统搜索引擎(TSEs,如Google)不同,这些系统对结果进行总结,通常提供有限的引用透明度。这一转变的影响尚未被充分探索,但引发了关于可信度和透明度的关键问题。在本文中,我们对LLM-SEs进行了大规模实证研究,分析了55,936个查询以及六个LLM-SEs和两个TSEs对应的搜索结果。我们确认LLM-SEs比TSEs以更大的多样性引用领域资源。事实上,37%的领域是LLM-SEs独有的。然而,某些风险仍然存在:LLM-SEs在可信度、政治中立性和安全性指标方面并不优于TSEs。最后,为了理解LLM-SEs的选择标准,我们进行了基于特征的分析,以识别影响源选择的关键因素。我们的发现为终端用户、网站所有者和开发者提供了可操作的见解。

关键词

引用

@article{arxiv.2512.09483,
  title  = {Source Coverage and Citation Bias in LLM-based vs. Traditional Search Engines},
  author = {Peixian Zhang and Qiming Ye and Zifan Peng and Kiran Garimella and Gareth Tyson},
  journal= {arXiv preprint arXiv:2512.09483},
  year   = {2025}
}