TFGN:无任务、无回放的持续预训练架构,在LLM规模下实现无灾难性遗忘
摘要
在LLM规模下,对异构文本领域进行持续预训练且不使用回放或任务标签,一直是未解决的架构问题。现有方法依赖回放缓冲区、任务标识符、规模不佳的正则化惩罚,或句子分类规模的评估。在本文中,我们引入TFGN,这是一种用于Transformer语言模型的架构叠加层,产生输入条件化、参数高效的更新,同时保持Transformer其余部分不变。在六个异构文本领域(散文、Python、数学、生物医学、中文、JavaScript)中,每个阶段10亿token,三个模型规模(约3.98亿、约7.39亿、约90亿)和两个 regime(从头训练和改造),TFGN在LLaMA 3.1 8B Retrofit中实现了-0.007的向后迁移,HellaSwag保持率为0.506/0.504/0.510,且在领域间实现>=99.59%的L2正交梯度分离,且无回放、无任务ID、无Fisher惩罚。相同矩阵显示出积极的跨域前向迁移:在LLaMA-8B Retrofit和GPT-2 Medium From-Scratch纯净从Python训练中,JavaScript困惑度下降26.8%和62.0%。在同一基座上,两个扩展进一步关闭开放问题。闭环元控制层(扩展A)在约3.98亿参数规模下将遗忘减少81%,映射到Dupoux等人(arXiv:2603.15381)的System A和System M角色。算子级计划向量(扩展B)在30个源->目标配对中实现99.96%的余弦保真度。架构洞察是Read/Write分解:前向传播完全稠密,而跨域参数更新结构化以避免先前领域子空间被写入。就我们知识而言,TFGN是首个在LLM规模下同时关闭灾难性遗忘、实现闭环自主学习元控制器,同时携带算子级潜在规划器的架构。
引用
@article{arxiv.2605.15053,
title = {TFGN: Task-Free, Replay-Free Continual Pre-Training Without Catastrophic Forgetting at LLM Scale},
author = {Anurup Ganguli},
journal= {arXiv preprint arXiv:2605.15053},
year = {2026}
}
备注
65 pages, 10 figures, 40 tables