中文

迁移学习的信息论分析

机器学习 2020-05-20 v2 机器学习

摘要

迁移学习或域适应,关注训练数据与测试数据可能来自不同分布(分别记为 μ\muμ\mu')的机器学习问题。在本工作中,我们遵循 Russo 和 Zhou 开创的研究思路,对迁移学习算法的泛化误差与超额风险进行了信息论分析。我们的结果表明(或许正如预期),Kullback-Leibler (KL) 散度 D(μμ)D(\mu||\mu') 在刻画域适应设定下的泛化误差中起着重要作用。具体而言,我们给出了通用迁移学习算法的泛化误差上界,并将结果推广到训练阶段同时拥有两种分布数据的特定经验风险最小化(ERM)算法。我们进一步将该方法应用于迭代的带噪声梯度下降算法,得到了仅利用学习算法参数即可轻松计算的上界。我们提供了若干说明性示例以展示结果的有用性。特别地,在特定分类问题中,我们的界比基于 Rademacher 复杂度导出的界更紧。

关键词

引用

@article{arxiv.2005.08697,
  title  = {Information-theoretic analysis for transfer learning},
  author = {Xuetong Wu and Jonathan H. Manton and Uwe Aickelin and Jingge Zhu},
  journal= {arXiv preprint arXiv:2005.08697},
  year   = {2020}
}

备注

Accepted paper in 2020 IEEE International Symposium on Information Theory (ISIT)