用于协变量偏移适应的最近邻采样
机器学习
2024-07-01 v2 机器学习
摘要
许多现有的协变量偏移适应方法通过估计赋予损失值的样本权重来缓解源分布与目标分布之间的差距。然而,估计最优权重通常涉及计算成本高昂的矩阵求逆和超参数调优。在本文中,我们提出了一种避免估计权重的新协变量偏移适应方法。其基本思想是直接处理无标签目标数据,并根据源数据集中的 最近邻对其进行标记。我们的分析表明,设定 是最优选择。这一性质消除了调整唯一超参数 的必要性,并使得运行时间在样本量上呈拟线性。我们的结果包括估计器的锐利收敛速率,对均方误差有严格的控制并具有显式常数。特别地,尽管我们的估计器具有非参数性质,其方差具有与标准参数估计相同的收敛速率。所提出的估计器与一些基于匹配的处理效应估计器具有相似性,例如在生物统计学、计量经济学和流行病学中使用的估计器。我们的实验表明,它在显著减少运行时间的同时保持了出色的准确率。
引用
@article{arxiv.2312.09969,
title = {Nearest Neighbor Sampling for Covariate Shift Adaptation},
author = {François Portier and Lionel Truquet and Ikko Yamane},
journal= {arXiv preprint arXiv:2312.09969},
year = {2024}
}