中文

大语言模型中的长尾知识:分类、机制、干预与影响

计算与语言 2026-02-19 v1 人工智能 计算机与社会

摘要

大语言模型(LLMs)是在大规模语料库上训练的,这些语料库呈现出陡峭的幂律分布,其中知识的分布高度呈长尾分布,大多数知识出现频率较低。虽然规模化训练提高了平均情况下的性能,但关于低频、领域特定、文化和时间相关知识的持续性失败仍然缺乏系统的特征化分析。本文构建了一个结构化的分类体系和分析框架,综合了技术与社会技术视角下关于大语言模型中长尾知识的 prior 工作。我们引入了一个结构化的分析框架,综合了四个互补的维度:长尾知识的定义方式、其在训练和推理过程中丢失或失真的机制、为缓解这些失败而提出的技术干预措施,以及这些失败对公平性、问责性、透明性和用户信任的影响。我们进一步检视了现有评估实践如何掩盖尾部行为,并使对罕见但重要失败的问责变得复杂化。本文以总结性方式阐述了与隐私、可持续性和治理相关的开放挑战,这些挑战限制了长尾知识的表征。综上所述,本文为理解大语言模型系统中长尾知识的定义、丢失、评估与表现提供了一个统一的概念框架。

关键词

引用

@article{arxiv.2602.16201,
  title  = {Long-Tail Knowledge in Large Language Models: Taxonomy, Mechanisms, Interventions and Implications},
  author = {Sanket Badhe and Deep Shah and Nehal Kathrotia},
  journal= {arXiv preprint arXiv:2602.16201},
  year   = {2026}
}