不变学习的几何:数据增强与泛化性的信息论分析
机器学习
2026-02-17 v1 人工智能
机器学习
摘要
数据增强是现代机器学习中最常用于提高泛化性的技术之一,通常因其能够促进对标签无关变换的不变性而被正当化。然而,其理论作用仍仅部分被理解。在本工作中,我们提出了一种信息论框架,系统性地解释数据增强对泛化性和不变性学习的影响。我们的ethods基于互信息边界,这些边界将泛化间隙与学习算法保留关于其训练数据的信息量相关联。我们通过将增强分布建模为原始数据分布与变换分布的组成,从而自然诱导一个轨道平均损失函数。 在对损失函数和增强过程假设满足轻度子高斯条件的基础上,我们推导出一种新的泛化界限,将期望泛化间隙分解为三个可解释的术语:(1) 原始数据与增强数据之间的分布性偏差,(2) 测量算法对训练数据的稳定性项,以及(3) 捕捉增强变异性效应的灵敏度项。为将我们的界限与增强群的几何联系起来,我们引入了“群直径”的概念,定义为增强可在输入空间诱导的最大扰动。群直径提供了一种统一的控制参数,能够界定所有三个术项,并突显一种内在的权衡:较小的直径保持数据忠实性,但提供有限的正则化;而较大的直径在数据偏差和灵敏度增加的代价下,提升了稳定性。我们通过数值实验验证了这些理论界限,证明其可靠地跟踪和预测真实泛化间隙的行为。
引用
@article{arxiv.2602.14423,
title = {The geometry of invariant learning: an information-theoretic analysis of data augmentation and generalization},
author = {Abdelali Bouyahia and Frédéric LeBlanc and Mario Marchand},
journal= {arXiv preprint arXiv:2602.14423},
year = {2026}
}