LLM文本生态系统中的漂移与选择
计算与语言
2026-04-13 v1 人工智能
摘要
公共文本记录——人类和 AI 系统学习的材料——正越来越受到自身输出的影响。生成的文本进入公共记录,后来的代理人从中学习,循环往复。我们基于可变阶数 n-gram 代理人构建了一个可精确求解的数学框架,用于此递归过程,并将两种作用力在公共语料库上加以区分。第一是漂移:未经过滤的重复使用逐渐删除稀有形式,在无限语料库极限下我们精确描述了稳定分布。第二是选择:出版、排序和验证对进入记录进行过滤,结果取决于所选择的内容。当出版仅反映统计现状时,语料库收敛于浅层状态,进一步的前瞻不带来任何好处。当出版是规范性的——奖励质量、正确性或新颖性——更深层的结构得以维持,我们建立了一个关于由选择性过滤导致的浅层平衡的optimal上限。该框架因此识别了递归出版何时压缩公共文本以及选择性过滤何时维持更丰富的结构,对 AI 训练语料库的设计具有启发意义。
引用
@article{arxiv.2604.08554,
title = {Drift and selection in LLM text ecosystems},
author = {Søren Riis},
journal= {arXiv preprint arXiv:2604.08554},
year = {2026}
}