构建知识:探索基于聊天的搜索引擎的创造性机制
信息检索
2024-03-01 v1 人工智能
综合经济学
经济学
摘要
在数字信息传播领域,搜索引擎是连接信息寻求者与提供者的关键渠道。利用大语言模型 (LLM) 和检索增强生成 (RAG) 的基于聊天的搜索引擎(以 Bing Chat 为代表)的出现,标志着搜索生态系统的进化飞跃。它们展示了在解读网络信息以及以类人的理解和创造力构建回复方面的元认知能力。然而,LLM 的复杂性质使其“认知”过程不透明,甚至对其设计者而言也难以理解。本研究旨在剖析由 LLM 驱动的基于聊天的搜索引擎(特别是 Bing Chat)为其回复选择信息源的机制。为此,我们通过与新 Bing 的交互编译了一个大型数据集,记录了其引用的网站以及传统搜索引擎列出的网站。采用自然语言处理 (NLP) 技术,研究发现 Bing Chat 倾向于选择不仅可读且结构正式,而且表现出较低困惑度 (perplexity) 的内容,这表明其独特地倾向于底层 LLM 可预测的文本。为进一步丰富我们的分析,我们通过基于 GPT-4 的知识检索 API 交互获取了额外数据集,揭示了 RAG API 与 Bing Chat 之间存在一致的文本偏好。这种共识表明,这些文本偏好内在地源于底层语言模型,而非由 Bing Chat 的开发者明确构建。此外,我们的调查记录到,与传统搜索引擎排名最高的网站相比,RAG 技术引用的网站之间具有更高的相似性。
引用
@article{arxiv.2402.19421,
title = {Crafting Knowledge: Exploring the Creative Mechanisms of Chat-Based Search Engines},
author = {Lijia Ma and Xingchen Xu and Yong Tan},
journal= {arXiv preprint arXiv:2402.19421},
year = {2024}
}
备注
38 pages, 2 figures, 7 tables