中文

ChatGPT 模型自收敛的实证研究

计算与语言 2026-03-17 v2 人工智能

摘要

在对合成数据进行递归训练的大语言模型(LLM)易受模型坍缩的影响,即生成无意义输出。现有研究从理论或经验角度考察此问题,常聚焦于单一模型在其自生成数据上进行递归训练。尽管先前研究警告 LLM 在此类条件下输出质量可能恶化,但尚无纵向研究评估其随时间演变的影响。本研究采用文本相似度指标评估不同 ChatGPT 模型生成多样化文本的能力。我们的发现表明,近期 ChatGPT 版本即使明确设置温度参数为1,也呈现生成文本多样性的可测下降。这种输出多样性的减少可能归因于其训练数据集中包含大量由 LLM 生成的数据,其互联网渗透导致。我们将这种现象定义为模型自收敛,因为不同 ChatGPT 版本生成文本的相似性逐渐增加。

关键词

引用

@article{arxiv.2603.12683,
  title  = {Experimental evidence of progressive ChatGPT models self-convergence},
  author = {Konstantinos F. Xylogiannopoulos and Petros Xanthopoulos and Panagiotis Karampelas and Georgios A. Bakamitsos},
  journal= {arXiv preprint arXiv:2603.12683},
  year   = {2026}
}