面向分布外泛化的理论框架
机器学习
2021-11-09 v3
摘要
对分布外(OOD)数据的泛化是现代机器学习的核心问题之一。近来,涌现出大量主要基于提取不变特征思想的算法尝试。尽管在直觉上合理,但对于何种不变性能保证 OOD 泛化,理论理解仍然有限,且对任意分布外数据的泛化显然是不可能的。在本工作中,我们朝严格且定量的定义迈出了第一步:1)什么是 OOD;以及 2)称一个 OOD 问题可学习意味着什么。我们还引入了扩张函数这一新概念,它刻画了在测试域上方差相对于训练域被放大的程度,从而赋予不变特征以定量含义。基于此,我们证明了 OOD 泛化误差界。结果表明 OOD 泛化在很大程度上依赖于扩张函数。正如 Gulrajani 与 Lopez-Paz(2020)近来所指出的,任何没有模型选择模块的分布外学习算法都是不完整的。我们的理论自然导出了一个模型选择准则。在基准 OOD 数据集上的大量实验表明,我们的模型选择准则相对于基线具有显著优势。
引用
@article{arxiv.2106.04496,
title = {Towards a Theoretical Framework of Out-of-Distribution Generalization},
author = {Haotian Ye and Chuanlong Xie and Tianle Cai and Ruichen Li and Zhenguo Li and Liwei Wang},
journal= {arXiv preprint arXiv:2106.04496},
year = {2021}
}