低维到高维泛化及其对长度泛化的影响
机器学习
2025-10-07 v3
摘要
低维到高维(LDHD)泛化是分布外(OOD)泛化的一种特殊情况,其中训练数据受限于高维测试空间的低维子空间。假设每个实例从潜在变量生成,潜变量的维度反映问题规模,LDHD 泛化可被用来捕捉长度泛化中的内在扩展挑战。我们在理论上表明,在不利用先验知识提供适当归纳偏置的情况下,LDHD 泛化通常不可实现。具体而言,我们在布尔函数上探讨 LDHD 泛化。我们验证,不同架构使用(S)GD 训练会收敛到 \emph{针对不同独立集的最小维度插值器}。当且仅当目标函数与此归纳偏置一致时,LDHD 泛化才可实现。将 LDHD 泛化的洞见应用于长度泛化,我们解释了通过改变潜在空间结构来实现更好 LDHD 泛化的 CoT 有效性。我们还提出了一种位置嵌入设计原则,用于处理内在的 LDHD 泛化以及数据格式等杂乱问题。遵循该原则,我们提出了一种新型位置嵌入,称为 RPE-Square,用于修复 RPE 在处理数据格式杂乱问题方面的局限性。
引用
@article{arxiv.2410.08898,
title = {Low-Dimension-to-High-Dimension Generalization And Its Implications for Length Generalization},
author = {Yang Chen and Long Yang and Yitao Liang and Zhouchen Lin},
journal= {arXiv preprint arXiv:2410.08898},
year = {2025}
}