合成来源?审计生成式搜索引擎引用的AI生成来源证据
信息检索
2026-05-25 v1 计算机与社会
摘要
大型语言模型通过对话界面向用户提问并从 web 上检索、综合并引用信息,从而大幅度简化了用户的信息寻求过程。然而,随着 web 上的 AI 生成内容的普及,尚不清楚这些引擎能否可靠地排除引用合成来源(即AI生成来源)。若这些引擎无法做到,则可能使用户风险升级,将来自AI生成来源的 synthesized 信息视为等同于权威或官方来源的信息。为识别AI生成来源是否被这些引擎引用,本工作审计了四个生成式搜索引擎(ChatGPT、Copilot、Gemini、Perplexity),使用712个真实世界的人类生成查询,涵盖政治、健康和环境等重要领域。我们的发现表明,所有四个生成式搜索引擎中都有AI生成来源被引用(~16%),并识别出这些来源所属的关键 web 域,这些域在这些引擎和主题中被频繁引用。此外,我们观察到生成式搜索引擎包括较窄的一组反复引用的域,同时在用户查询响应中主要呈现大量 minimally 引用的域。这些发现为评估生成式搜索引擎风险的日益增长的工作量提供了贡献,旨在提高公众对其局限性的 awareness,并鼓励采取适当措施以提高信息质量和治理这些系统。
引用
@article{arxiv.2605.23684,
title = {Synthetic Sources?: Auditing Generative Search Engine Citations for Evidence of AI-Generated Sources},
author = {Mowafak Allaham and Nicholas Diakopoulos},
journal= {arXiv preprint arXiv:2605.23684},
year = {2026}
}
备注
11 pages + Appendix