中文

表示贝叶斯风险分解与多源域适应

机器学习 2020-06-05 v2 机器学习

摘要

我们考虑表示学习(假设类 H=FG\mathcal{H} = \mathcal{F}\circ\mathcal{G}),其中训练与测试分布可能不同。近期研究为域不变表示学习(解决该问题的常用方法)提供了线索与失败案例,但所给解释略有差异且未提供统一图景。本文中,我们给出风险的新分解,给出更细粒度的解释并澄清潜在的泛化问题。对于单源域适应,我们通过自然的混合论证给出目标风险的精确分解(等式),将其表示为三个因子之和:(1)源风险,(2)表示条件标签散度,以及(3)表示协变量偏移。我们推导了多源情形下的类似分解。这些分解揭示因子(2)和(3)为泛化失败的精确原因。例如,我们证明域对抗神经网络(DANN)试图对(3)正则化却忽略了(2),而近期技术不变风险最小化(IRM)试图考虑(2)却未考虑(3)。我们也通过实验验证了我们的观察。

关键词

引用

@article{arxiv.2004.10390,
  title  = {Representation Bayesian Risk Decompositions and Multi-Source Domain Adaptation},
  author = {Xi Wu and Yang Guo and Jiefeng Chen and Yingyu Liang and Somesh Jha and Prasad Chalasani},
  journal= {arXiv preprint arXiv:2004.10390},
  year   = {2020}
}

备注

21 pages, 6 figures