中文

大语言模型中的认识多样性与知识崩溃

计算与语言 2026-01-29 v6 人工智能 计算机与社会 信息检索 机器学习

摘要

大语言模型 (LLM) 倾向于生成同质化的文本,这可能影响其在不同输出中生成知识的多样性。鉴于其潜在取代现有知识获取形式的能力,这构成了一种知识崩溃风险,即同质化的 LLM 可能导致大多数人暴露于 largely 相同的信息,从而在时间上导致可访问信息范围的收缩,因为未被充分代表的知识将被遗忘。为评估 LLM 带来的知识崩溃风险,我们提出了一种新方法来衡量认识多样性,即 LLM 输出中真实世界诉求变异性。我们利用此方法进行广泛的实证研究,测试了 27 个 LLM,覆盖 155 个主题(涵盖 12 个国家),并采集了 200 个来自真实用户聊天的提示模板。对于我们研究中的主题,结果表明虽然较新的模型倾向于生成更具多样性的诉求,但所有模型都不如基本的 web 搜索那样具备认识多样性。我们发现模型规模对认识多样性产生负面影响,而检索增强生成 (RAG) 则具有正面影响,尽管 RAG 的改进效果因文化背景而异。最后,我们与传统知识来源 (Wikipedia) 进行比较,发现国家特定诉求更偏向英语语言,而非当地语言,这凸显了认识表征之间的差距。

关键词

引用

@article{arxiv.2510.04226,
  title  = {Epistemic Diversity and Knowledge Collapse in Large Language Models},
  author = {Dustin Wright and Sarah Masud and Jared Moore and Srishti Yadav and Maria Antoniak and Peter Ebert Christensen and Chan Young Park and Isabelle Augenstein},
  journal= {arXiv preprint arXiv:2510.04226},
  year   = {2026}
}

备注

16 pages; 8 figures, 4 tables; v2 changelog: Fixed the modeling for table 3, random effect is the model version; v3 changelog: Fixed minor formatting issues in tables 2 and 3; v4 changelog: Fixed some typos and model description; v5 changelog: Updated metadata; v6 changelog: Improved search baseline, writing revisions, added comparisons to semantic similarity only approaches