子网络结构能否成为分布外泛化的关键?
机器学习
2021-06-08 v1 机器学习
摘要
具有特定结构的模型能否避免在分布外(OOD)泛化中偏向于虚假关联?Peters 等人(2016)对线性情况给出了肯定答案。本文中,我们使用功能模块探测方法分析 OOD 设定下的深度模型结构。我们证明,即使在有偏模型(关注虚假关联)中,仍存在无偏的功能子网络。此外,我们提出并验证了功能彩票假设:完整网络包含一个可实现更好 OOD 性能的子网络。我们随后提出模块化风险最小化以解决子网络选择问题。我们的算法从给定数据集中学习子网络结构,并可与其他任何 OOD 正则化方法结合。在各种 OOD 泛化任务上的实验证实了该方法的有效性。
引用
@article{arxiv.2106.02890,
title = {Can Subnetwork Structure be the Key to Out-of-Distribution Generalization?},
author = {Dinghuai Zhang and Kartik Ahuja and Yilun Xu and Yisen Wang and Aaron Courville},
journal= {arXiv preprint arXiv:2106.02890},
year = {2021}
}
备注
Accepted to ICML2021 as long talk