中文

通过位置课程和模板多样性缓解文本模块化算术中的位置偏移故障

机器学习 2026-01-09 v1 计算与语言

摘要

基于 grokking 文献中的见解,我们研究了在字符级别的 Transformer 中训练以从文本中计算模块化加法的模型,关注输入格式变体下的鲁棒性,而不仅仅是准在分布准确性。我们识别出一个此前被忽视的故障模式:即使模型在准在分布上取得高准确率,在相同表达式移至不同绝对字符位置(“位置偏移”)或以不同于训练时的自然语言模板呈现时,仍会发生灾难性失败。使用 p=97 的所有有序对进行的不相干配对分割,我们显示基线模型在准在分布上取得强性能,但在位置偏移和模板 OOD 上崩溃。随后,我们引入一种简单的训练配方,结合(i)显式的表达式边界标记,(ii)位置课程以扩大训练期间看到的绝对位置范围,(iii)多样化的模板混合,以及(iv)跨多个变体的一致性训练。对于三个随机种子,本干预在位置偏移和模板 OOD 上显著提高了鲁棒性,同时保持高准在分布准确性,而 ALiBi 风格的消除实验在我们的设置下无法学习该任务。我们的结果表明,在噪声监督下引导程序化泛化受益于显式训练那些原本缺失于数据分布中的不变性,我们提供了可复现的评估协议和构件。

关键词

引用

@article{arxiv.2601.04283,
  title  = {Mitigating Position-Shift Failures in Text-Based Modular Arithmetic via Position Curriculum and Template Diversity},
  author = {Nikolay Yudin},
  journal= {arXiv preprint arXiv:2601.04283},
  year   = {2026}
}