标签偏移的广义方法:条件概率偏移模型
机器学习
2025-03-05 v1 机器学习
摘要
在机器学习的许多实际应用中,抽取带标签训练样本的源分布与仅观测到无标签数据的目标分布之间常常存在差异。传统上,解决该问题主要考虑两种场景:协变量偏移(CS),即仅特征边缘分布发生变化;以及标签偏移(LS),即涉及类别变量先验分布的变化。然而,这些框架并未涵盖所有形式的分布偏移。本文引入了一种新设定,即条件概率偏移(CPS),用于刻画当给定某些特定特征时类别变量的条件分布发生变化,而在给定这些特定特征和类别变量时其余特征的分布保持不变的情形。针对此场景,我们提出了条件概率偏移模型(CPSM),该模型基于使用多项式回归对类别变量的条件概率进行建模。由于目标数据中类别变量未被观测,其分布的多项式模型参数采用期望最大化算法进行估计。所提方法具有通用性,可与任何概率分类器结合使用。通过在合成数据集上的实验以及使用 MIMIC 医疗数据库的案例研究,验证了 CPSM 的有效性,结果表明与现有方法相比,其在目标数据上具有更优的平衡分类准确率,特别是在条件分布偏移以及无先验分布偏移(无法被基于 LS 的方法检测到)的情形下表现突出。
引用
@article{arxiv.2503.02583,
title = {A generalized approach to label shift: the Conditional Probability Shift Model},
author = {Paweł Teisseyre and Jan Mielniczuk},
journal= {arXiv preprint arXiv:2503.02583},
year = {2025}
}