数据分布属性作为系统一般化的归纳偏置
机器学习
2025-06-19 v3
摘要
深度神经网络 (DNN) 在系统一般化 (SG) 上存在困难。虽然已有多项研究评估了通过提出新型架构、损失函数或训练方法来促进 SG 的可能性,但鲜有研究关注训练数据属性在促进 SG 中的作用。本文我们研究了某些数据分布属性作为 SG 能力的归纳偏置的影响。为此,我们研究了三个不同的属性。首先,数据多样性,表现为训练分布中潜在属性可能取值的数量增加。其次,burstiness,即在特定输入上以概率方式限制潜在因子可能的取值数量。第三,潜在干预,即在训练期间随机改变特定潜在因子。我们发现这三个因素都显著增强了 SG,其中多样性在最受影响的属性上带来了 89% 的绝对准确率提升。通过一系列实验,我们测试了各种假设以了解这些属性为何促进 SG。最后,我们发现训练分布中潜在属性之间的归一化互信息 (NMI) 对 out-of-distribution generalizat ion 具有强大的预测性。我们发现,较低的 NMI 如何导致 SG 的一种机制是表示的几何结构。特别是,我们发现 NMI 导致神经表示中更高的平行性(即输入特征以平行神经向量编码),这与推理类比的能力密切相关。
引用
@article{arxiv.2502.20499,
title = {Data Distributional Properties As Inductive Bias for Systematic Generalization},
author = {Felipe del Rio and Alain Raymond-Saez and Daniel Florea and Rodrigo Toro Icarte and Julio Hurtado and Cristian B. Calderon and Alvaro Soto},
journal= {arXiv preprint arXiv:2502.20499},
year = {2025}
}
备注
CVPR 2025