中文

隐协变量偏移:释放多源域适应的部分可辨识性

机器学习 2025-04-03 v4 机器学习

摘要

多源域适应(MSDA)旨在利用多个源域的标注数据与目标域的无标注数据,学习一个用于无标注目标域的标签预测函数。传统的 MSDA 方法通常依赖于协变量偏移或条件偏移范式,其假设各域间标签分布一致。然而,在标签分布确实随域变化的实际场景中,该假设显得局限,削弱了其在真实环境中的适用性。例如,由于饮食和基因的差异,不同地区的动物表现出多样特征。受此启发,我们提出一种称为隐协变量偏移(LCS)的新范式,它在各域间引入了显著更强的可变性与适应性。值得注意的是,它为恢复标签变量的隐成因(我们称之为隐内容变量)提供了理论保证。在这一新范式下,我们提出一个精细的因果生成模型,通过引入跨域的隐噪声,以及隐内容变量与隐风格变量,以更细致地刻画观测数据。我们证明,由于其多变而独特的因果结构,隐内容变量可辨识至块可辨识性。我们将理论洞见落实为一种新颖的 MSDA 方法,该方法学习以可辨识隐内容变量为条件的标签分布,从而适应更大幅度的分布偏移。所提方法在仿真与真实数据集上均展现出卓越的性能与效果。

关键词

引用

@article{arxiv.2208.14161,
  title  = {Latent Covariate Shift: Unlocking Partial Identifiability for Multi-Source Domain Adaptation},
  author = {Yuhang Liu and Zhen Zhang and Dong Gong and Mingming Gong and Biwei Huang and Anton van den Hengel and Kun Zhang and Javen Qinfeng Shi},
  journal= {arXiv preprint arXiv:2208.14161},
  year   = {2025}
}