中文

通过控制归一化间隔研究泛化能力

机器学习 2022-09-21 v3

摘要

权重范数 w\|w\| 与间隔 γ\gamma 通过归一化间隔 γ/w\gamma/\|w\| 参与学习理论。由于标准神经网络优化器不控制归一化间隔,很难检验该量是否与泛化存在因果关系。本文设计了一系列明确控制归一化间隔的实验研究,从而解决两个核心问题。第一:归一化间隔是否总是对泛化有因果效应?本文发现并非如此——可以构造出归一化间隔与泛化看似无关的网络,这与 Bartlett 等人 (2017) 的理论相悖。第二:归一化间隔是否曾经对泛化有因果效应?本文发现确实如此——在标准训练设定下,测试性能紧密跟踪归一化间隔。本文提出一个高斯过程模型作为对此行为的有前景的解释。

关键词

引用

@article{arxiv.2205.03940,
  title  = {Investigating Generalization by Controlling Normalized Margin},
  author = {Alexander R. Farhang and Jeremy Bernstein and Kushal Tirumala and Yang Liu and Yisong Yue},
  journal= {arXiv preprint arXiv:2205.03940},
  year   = {2022}
}