中文

多任务学习中的无免费午餐定理

机器学习 2020-08-07 v4 统计理论 机器学习 统计理论

摘要

多任务学习及相关领域(如多源域适应)针对现代设定,其中来自NN个相关分布{Pt}\{P_t\}的数据集被组合以改进任一此类分布D{\cal D}上的性能。在该主题不断发展的理论中仍存在一个令人困惑的事实:尽管我们希望有能解释多任务贡献的性能界,绝大多数分析得到的界至多按每任务样本数nn改善,而最常并不随NN改善。因此,初看之下此类分析中所考虑的分布设定或聚合过程似乎不利;然而,正如我们所展示的,情况实则更微妙,存在看似有利却有趣地困难的 regime。具体地,我们考虑一个看似有利的分类场景,其中所有任务PtP_t共享一个公共最优分类器hh^*,并且可证明该场景承认一系列在NNnn方面具有改进 oracle 率的广泛 regime。我们的若干主要结果如下:\bullet 我们表明,尽管此类 regime 承认考虑nnNN的极小极大率,但不存在自适应算法;即,在无分布信息访问的情况下,任何算法都无法保证在nn固定时随大NN改善的率。\bullet 借助一点额外信息,即按任务{Pt}\{P_t\}到目标D{\cal D}的距离对任务排序,一种简单的基于排序的过程可实现近乎最优的任务数据集聚合,尽管搜索空间在NN中是指数的。有趣的是,最优聚合可能排除某些任务,即便它们都共享相同的hh^*

关键词

引用

@article{arxiv.2006.15785,
  title  = {A No-Free-Lunch Theorem for MultiTask Learning},
  author = {Steve Hanneke and Samory Kpotufe},
  journal= {arXiv preprint arXiv:2006.15785},
  year   = {2020}
}