协变量偏移自适应中的有效样本量、维度与泛化
机器学习
2022-01-11 v5 人工智能
机器学习
统计方法学
摘要
在有监督学习中,训练与测试数据集通常从不同的分布中采样。因此需要使用域自适应技术。当域之间仅由特征边际分布不同时,协变量偏移自适应能取得良好的泛化性能。协变量偏移自适应通常通过重要性加权实现,而根据普遍看法,由于有效样本量(ESS)较小,该方法可能失效。先前的研究认为这种情形在高维设定中更为常见。然而,在考虑协变量偏移自适应的背景下,有效样本量、维度与模型性能/泛化在有监督学习中如何形式化地关联,在文献中仍有些模糊。因此,一个主要挑战是提出一个统一理论来连接这些要点。故此,在本文中,我们聚焦于构建统一视角,在协变量偏移自适应背景下连接ESS、数据维度与泛化。此外,我们还展示了降维或特征选择如何能增加ESS,并主张我们的结果支持在协变量偏移自适应之前进行降维是一种良好实践。
引用
@article{arxiv.2010.01184,
title = {Effective Sample Size, Dimensionality, and Generalization in Covariate Shift Adaptation},
author = {Felipe Maia Polo and Renato Vicente},
journal= {arXiv preprint arXiv:2010.01184},
year = {2022}
}
备注
Neural Comput & Applic (2022)