中文

论域适应与半监督学习中的因果性:参数模型的信息论分析

机器学习 2024-09-17 v2 信息论 math.IT

摘要

无监督域适应(UDA)与半监督学习(SSL)的近期进展,尤其是因果性的引入,显著改进了这些学习问题的方法论。然而,解释因果性在 UDA/SSL 泛化性能中作用的正式理论仍属缺失。本文考虑如下 UDA/SSL 场景:在不同因果设定下,以参数概率模型访问 mm 个有标源数据与 nn 个无标目标数据作为训练样本。我们从信息论视角研究目标域预测的学习性能(如过量风险)。具体而言,我们区分两种场景:若特征为因、标签为果,则称该学习问题为因果学习;否则称为反因果学习。我们表明,在因果学习中,仅当源域与目标域间标注分布不变时,过量风险以 O(1m)O(\frac{1}{m}) 的速率依赖于源样本量。在反因果学习中,我们表明无标数据以典型 O(1n)O(\frac{1}{n}) 的速率主导性能。这些结果揭示了不同因果机制下数据样本量与学习问题难度间的关系。

关键词

引用

@article{arxiv.2205.04641,
  title  = {On Causality in Domain Adaptation and Semi-Supervised Learning: an Information-Theoretic Analysis for Parametric Models},
  author = {Xuetong Wu and Mingming Gong and Jonathan H. Manton and Uwe Aickelin and Jingge Zhu},
  journal= {arXiv preprint arXiv:2205.04641},
  year   = {2024}
}

备注

56 pages Including Appendix