中文

增强还是不增强?诊断分布对称性破缺

机器学习 2026-03-31 v2 机器学习

摘要

机器学习中感知对称性的方法(如数据增强和等变架构)旨在促使模型在原始数据集的所有变换(例如旋转或置换)上表现出正确的行为。这些方法能够提升泛化能力和样本效率,其假设前提是变换后的数据点在测试分布下具有高概率或“重要性”。在本工作中,我们开发了一种严格评估该假设的方法。具体而言,我们提出了一种度量指标,通过双样本分类器测试来量化数据集中对称性破缺的程度,该测试能够区分原始数据集与其随机增强的对应数据集。我们在合成数据集上验证了该度量指标,随后将其用于揭示几个基准点云数据集中存在的高程度对称性破缺,这构成了一种严重的数据集偏差。我们从理论上证明,在无限特征极限下,对于不变岭回归,即使底层标签是真正不变的,分布对称性破缺也会阻碍不变方法达到最优性能。从经验上看,这种影响对感知对称性方法的作用取决于数据集:等变方法在某些存在对称性偏差的数据集上仍能带来益处,但在其他数据集上则不然,尤其是当对称性偏差能够预测标签时。总体而言,这些发现表明,理解等变性——包括其何时有效以及为何有效——可能需要重新审视数据中的对称性偏差。

关键词

引用

@article{arxiv.2510.01349,
  title  = {To Augment or Not to Augment? Diagnosing Distributional Symmetry Breaking},
  author = {Hannah Lawrence and Elyssa Hofgard and Vasco Portilheiro and Yuxuan Chen and Tess Smidt and Robin Walters},
  journal= {arXiv preprint arXiv:2510.01349},
  year   = {2026}
}

备注

Published as a conference paper at ICLR 2026. A short version of this paper appeared at the ICLR AI4Mat workshop in April 2025