填中掩码预训练的记忆动力学
计算与语言
2026-05-25 v1 人工智能
机器学习
摘要
填中掩码(FIM)是一种广泛用于赋予因果语言模型拥有填充能力的预训练目标,但其对逐字记忆的影响仍未得到充分探索。我们在受控环境下研究 FIM 的记忆动力学,通过在包含重复吉辰斯特恩段落的 FineWeb-Gutenberg 语料库上,对预训练的匹配 Llama 3.2 模型采用 FIM 和标准从左到右(LTR)目标进行比较。我们使用基于前缀的探针发现,FIM 更常恢复短句或部分匹配的片段,而 LTR 更常对长篇准确继续赋值信。我们观察到,在测试范围内,FIM 训练下的逐字提取大约随重复次数呈线性增长。评估原生 FIM 格式的探针发现,后缀上下文并不足够:FIM 训练下的逐字记忆仍严格依赖前缀上下文。我们的结果还表明,仅评估一种片段长度或探针格式可能会遗漏记忆行为中重要的细微差别。
引用
@article{arxiv.2605.22981,
title = {Memorization Dynamics of Fill-in-the-Middle Pretraining},
author = {Tobias von Arx and Tanguy Dieudonné},
journal= {arXiv preprint arXiv:2605.22981},
year = {2026}
}
备注
MemFM @ ICML 2026