中文

分布偏移下从弱监督学习稳定预测器

机器学习 2026-05-20 v3 人工智能

摘要

当真实标签不可用时,从弱监督、代理监督或相对监督中学习是常见的,但分布偏移下的鲁棒性仍了解甚少,因为监督机制本身可能在不同环境中发生变化。我们将这一现象形式化为监督漂移,定义为跨上下文中 P(yx,c)P(y \mid x, c) 的变化,并在 CRISPR-Cas13d 转录扰动实验中对其进行研究,其中引导效率是通过 RNA-seq 响应间接推断的。利用公开可用的数据,涵盖两种人类细胞系和多个诱导后时间点,我们构建了一个受控的非 IID 基准,具有明确的领域(细胞系)和时间偏移,同时跨所有上下文复用固定的弱标签构建以避免改变目标。在所有模型类别中,弱监督在域内(ridge R2=0.356R^2 = 0.356,Spearman ρ=0.442\rho = 0.442)和部分跨细胞系迁移(ρ0.40\rho \approx 0.40)中支持有意义的学习。相比之下,时间迁移在所有考虑的模型类别中均崩溃,产生负 R2R^2 和弱或接近零的 ρ\rho(ridge R2=0.145R^2 = -0.145ρ=0.008\rho = 0.008;XGBoost R2=0.155R^2 = -0.155ρ=0.056\rho = 0.056;random forest R2=0.322R^2 = -0.322ρ=0.139\rho = 0.139)。使用外部重新计算的弱标签、偏移分数量化和简单缓解基线的额外鲁棒性分析保留了相同的定性模式。特征-标签关联和特征重要性分析在细胞系之间保持相对稳定,但随时间急剧变化,表明失败源于监督漂移而非模型容量或简单的协变量偏移。这些结果表明,弱监督下的强域内性能可能具有误导性,并启发特征稳定性作为部署前非可迁移性的轻量级诊断指标。

关键词

引用

@article{arxiv.2604.05002,
  title  = {Learning Stable Predictors from Weak Supervision under Distribution Shift},
  author = {Mehrdad Shoeibi and Elias Hossain and Ivan Garibay and Niloofar Yousefi},
  journal= {arXiv preprint arXiv:2604.05002},
  year   = {2026}
}