AI 模型的未来:关于模型崩溃的计算视角
摘要
人工智能,特别是大语言模型(LLM),已在软件工程、新闻、创意写作、学术界和媒体等领域取得变革性突破。扩散模型如Stable Diffusion能够从文本生成高质量图像和视频。证据显示快速扩张:74.2%的新发布网页包含 AI 生成内容(Ryan Law 2025),30-40%的活跃网页语料为合成内容(Spennemann 2025;arXiv:2504.08755),52%的美国成年人使用 LLM 进行写作、编码或研究(Staff 2025),审计发现 AI 在18%的金融投诉和24%的新闻稿中发挥作用(Liang 等 2025)。底层神经网络架构,包括Transformer(Vaswani 等 2023;arXiv:1706.03762)、RNN、LSTM、GAN 和扩散网络,依赖于大规模多样化的人类撰写数据集(Shi & Iyengar 2019)。随着合成内容主导,递归训练风险会侵蚀语言和语义多样性,导致模型崩溃(Shumailov 等 2024;arXiv:2307.15043;Dohmatob 等 2024;arXiv:2402.07712)。本研究通过检查 2013至2025 年英语维基百科(过滤后的 Common Crawl)中逐年的语义相似度,利用 Transformer 嵌入和余弦相似度度量来量化和预测崩溃发生。结果显示,在公众 LLM adoption 之前,相似度呈稳步上升,可能由早期 RNN/LSTM 翻译和文本规范化管道驱动,虽然规模较小但影响有限。观察到的波动反映了不可消除的语言多样性、年度语料库规模差异、有限抽样误差,以及 LLM 模型公众 adoption 后相似度呈指数级上升。这些发现提供了数据驱动的估计,预测递归 AI 污染何时可能显著威胁数据丰富性和模型泛化能力。
引用
@article{arxiv.2511.05535,
title = {Future of AI Models: A Computational perspective on Model collapse},
author = {Trivikram Satharasi and S Sitharama Iyengar},
journal= {arXiv preprint arXiv:2511.05535},
year = {2025}
}
备注
Submitted to Springer Nature. Code Available at https://github.com/t-satharasi/AI-Modal-Collapse-Code-for-Reproduction.git