层次真理:探讨持续预训练中事实认知的转移
机器学习
2026-02-09 v3 密码学与安全
摘要
我们表明,持续预训练过程中对合理误导信息的反复学习,能够在不影响整体性能的前提下覆盖大语言模型中特定事实知识。与现有针对静态预训练的投毒工作不同,本文研究在持续更新过程中反复暴露于虚构陈述的情况。通过使用带有分级投毒比例的事实-反事实配对样本,跟踪不同检查点、不同层次以及不同模型规模下内部偏好在竞争事实之间的演变。即使是中等程度的投毒(50%-100%),也会使超过 55% 的响应从正确答案转为反事实答案,而保持模糊性几乎不变。这些认知翻转突然出现,集中在后期层(例如 3B 模型中的第 29-36 层),通过补丁化可部分逆转(最高达 56.8%)。被破坏的信念会在投毒提示之外的情境中泛化,选择性地降低常识推理能力,但保持对齐基准测试的完整性,并在不同语言之间传递不完全。这些结果揭示了持续预训练的一种缺陷模式,即针对性的误导信息取代内部事实表征而不引发广泛性能崩溃,动机在于在模型更新期间对事实完整性进行表征层面的监控。
引用
@article{arxiv.2510.26829,
title = {Layer of Truth: Probing Belief Shifts under Continual Pre-Training Poisoning},
author = {Svetlana Churina and Niranjan Chebrolu and Kokil Jaidka},
journal= {arXiv preprint arXiv:2510.26829},
year = {2026}
}