中文

归纳签名不够:基于匹配计算的In-Context学习中的负载结构研究

计算与语言 2026-03-17 v2 人工智能 机器学习

摘要

机制导向的合成数据日益被提议作为引导预训练以获得可取能力的方法,但仍不清楚应如何评估此类干预。我们在匹配计算 (iso-FLOPs) 下研究此问题,对In-Context学习 (ICL) 进行评估,使用 Bi-Induct 这种轻量级数据重写,该方法在自然预训练流中交错插入短程有向复制片段:前向复制 (归纳)、后向复制 (反归纳,作为有向控制) 或平衡混合。对于 0.13B-1B 的 decoder-only 模型,我们评估 (i) 在标准 LM 基准和函数风格 ICL 探针上的few-shot性能、(ii) 头级复制遥测、(iii) 持留 perplexity 作为警戒线。Bi-Induct 可靠地增加归纳头活性,但这并不转化为在few-shot泛化上的一致性改进:在标准 LM 基准上,Bi-Induct 相对于仅自然训练基本保持中性,而在函数风格探针上,1B 自然-only 模型表现最佳。尽管存在明确的反向复制线索,反归纳得分在各规模下仍接近零,揭示了强烈的前向/后向非对称性。针对性消除实验证明,区别更为明显:移除每层顶部 2% 的归纳头会对 ICL 造成更大影响,与匹配的随机消除相比,最大相对下降发生在自然-only 模型中。这表明自然-only 训练产生更集中、承载性更强的归纳电路,而 Bi-Induct 倾向于创建更分布式和冗余的归纳活动。我们的主要结论是,引发一种机制并不等同于使其成为负载关键组件。对于数据中心的基础模型设计,这表明合成数据干预不仅应通过签名放大来评估,还应评估其是否创建因果必需的计算,同时保持自然数据建模质量。

关键词

引用

@article{arxiv.2509.22947,
  title  = {Induction Signatures Are Not Enough: A Matched-Compute Study of Load-Bearing Structure in In-Context Learning},
  author = {Mohammed Sabry and Anya Belz},
  journal= {arXiv preprint arXiv:2509.22947},
  year   = {2026}
}

备注

Published as a paper at 3rd DATA-FM workshop @ ICLR 2026, Brazil