多任务学习中的无免费午餐定理
机器学习
2020-08-07 v4 统计理论
机器学习
统计理论
摘要
多任务学习及相关领域(如多源域适应)针对现代设定,其中来自个相关分布的数据集被组合以改进任一此类分布上的性能。在该主题不断发展的理论中仍存在一个令人困惑的事实:尽管我们希望有能解释多任务贡献的性能界,绝大多数分析得到的界至多按每任务样本数改善,而最常并不随改善。因此,初看之下此类分析中所考虑的分布设定或聚合过程似乎不利;然而,正如我们所展示的,情况实则更微妙,存在看似有利却有趣地困难的 regime。具体地,我们考虑一个看似有利的分类场景,其中所有任务共享一个公共最优分类器,并且可证明该场景承认一系列在与方面具有改进 oracle 率的广泛 regime。我们的若干主要结果如下: 我们表明,尽管此类 regime 承认考虑与的极小极大率,但不存在自适应算法;即,在无分布信息访问的情况下,任何算法都无法保证在固定时随大改善的率。 借助一点额外信息,即按任务到目标的距离对任务排序,一种简单的基于排序的过程可实现近乎最优的任务数据集聚合,尽管搜索空间在中是指数的。有趣的是,最优聚合可能排除某些任务,即便它们都共享相同的。
引用
@article{arxiv.2006.15785,
title = {A No-Free-Lunch Theorem for MultiTask Learning},
author = {Steve Hanneke and Samory Kpotufe},
journal= {arXiv preprint arXiv:2006.15785},
year = {2020}
}