中文

超越不变性:面向带有“虚假”相关性的分布的测试时标签偏移自适应

机器学习 2023-11-30 v4 计算机视觉与模式识别 机器学习

摘要

测试时数据分布的变化可能对预测模型 p(yx)p(y|x) 的性能产生有害影响。我们考虑存在额外元数据标签(例如组标签)的情况,记为 zz,这些标签可以解释分布中的此类变化。特别地,我们假设先验分布 p(y,z)p(y, z)(它建模了类别标签 yy 与“干扰”因素 zz 之间的依赖关系)可能跨域变化,这可能是由于这些项之间相关性的变化,或是它们某个边缘分布的变化。然而,我们假设特征的生成模型 p(xy,z)p(x|y,z) 跨域保持不变。我们注意到,这对应于广泛使用的“标签偏移”假设的一个扩展版本,其中标签现在也包括干扰因素 zz。基于这一观察,我们提出了一种测试时标签偏移校正方法,该方法通过将期望最大化(EM)算法应用于来自目标域分布 pt(x)p_t(x) 的无标签样本,来适应联合分布 p(y,z)p(y, z) 的变化。重要的是,我们能够避免拟合生成模型 p(xy,z)p(x|y, z),而只需对在源分布上训练的判别模型 ps(y,zx)p_s(y, z|x) 的输出进行重新加权。我们在几个标准图像和文本数据集以及 CheXpert 胸部 X 光数据集上评估了我们称之为“测试时标签偏移自适应”(TTLSA)的方法,并表明它相较于针对分布变化不变性的方法以及基线经验风险最小化方法,均提升了性能。用于复现实验的代码可在 https://github.com/nalzok/test-time-label-shift 获取。

关键词

引用

@article{arxiv.2211.15646,
  title  = {Beyond Invariance: Test-Time Label-Shift Adaptation for Distributions with "Spurious" Correlations},
  author = {Qingyao Sun and Kevin Murphy and Sayna Ebrahimi and Alexander D'Amour},
  journal= {arXiv preprint arXiv:2211.15646},
  year   = {2023}
}

备注

24 pages, 7 figures