生成式 AI 时代的信息检索:RGB 模型
信息检索
2026-02-12 v1 人工智能
性能
摘要
大型语言模型(LLM)和生成式 AI 的出现正在从根本上改变互联网上的信息检索与处理,带来巨大潜力与关于内容真实性与可靠性的重大关切。本文提出一种新颖的定量方法,以为日益复杂的信息动力学提供启发。尽管这些动力学对数字生态系统影响显著,但仍鲜为人知且理解不足。我们提出一种随机模型来刻画新主题信息的生成、索引与传播过程。这种情景尤其挑战当前 LLM,因为它们往往依赖实时检索增强生成(RAG)技术来克服静态知识局限。我们的发现表明,生成式 AI 采用速度与用户依赖程度的快速增长,可能超过人类验证速度,导致 inaccurate 信息在数字资源中的扩散风险升级。对 Stack Exchange 数据的深入分析表明,高质量答案不可避免地需要大量时间和人力成本才能形成。这凸显了针对新问题生成有说服力文本的风险,突显了对未来生成式 AI 工具负责任开发与部署的 critical 需求。
引用
@article{arxiv.2504.20610,
title = {Information Retrieval in the Age of Generative AI: The RGB Model},
author = {Michele Garetto and Alessandro Cornacchia and Franco Galante and Emilio Leonardi and Alessandro Nordio and Alberto Tarable},
journal= {arXiv preprint arXiv:2504.20610},
year = {2026}
}
备注
To be presented at ACM SIGIR 25