元学习中如何跨任务分配数据?
机器学习
2022-04-11 v3
摘要
元学习模型将先前任务获得的知识迁移以快速学习新任务。它们在每个任务具有固定数量数据点的基准上训练。该数量通常是任意的,且未知其如何影响测试性能。由于数据标注成本高昂,寻找训练任务间标签的最优分配可降低开销。给定固定的标签预算,我们应当使用少量高度标注的任务,还是许多每任务仅有少量标签的任务?我们是否应将更多标签分配给某些任务而更少给另一些?我们表明:1)若任务同质,则存在均匀最优分配,即所有任务获得相同数量数据;2)在固定预算下,任务数量与每任务数据点数量之间存在权衡,且最优解唯一;3)当分别训练时,更难的任务应获得更多数据,代价是任务数量减少;4)当在易任务和难任务混合上训练时,应将更多数据分配给易任务。有趣的是,神经科学实验表明人类视觉技能也从易任务迁移得更好。我们在混合线性回归上从数学上证明了这些结果,并凭经验展示相同结果在 CIFAR-FS 和 mini-ImageNet 的少样本图像分类上成立。我们的结果为元学习数据收集时跨任务分配标签提供了指导。
引用
@article{arxiv.2103.08463,
title = {How to distribute data across tasks for meta-learning?},
author = {Alexandru Cioba and Michael Bromberg and Qian Wang and Ritwik Niyogi and Georgios Batzolis and Jezabel Garcia and Da-shan Shiu and Alberto Bernacchia},
journal= {arXiv preprint arXiv:2103.08463},
year = {2022}
}
备注
Published in AAAI 2022