小数据学习综述:泛化、优化与挑战
机器学习
2023-06-07 v2
摘要
大数据学习为人工智能(AI)带来了成功,但其标注与训练成本高昂。未来,逼近大数据泛化能力的小数据学习是 AI 的终极目标之一,它要求机器像人类一样依靠小数据识别目标与场景。一系列学习课题正沿此方向展开,如主动学习与少样本学习。然而,它们的泛化性能鲜有理论保证。此外,多数设定是被动的,即标签分布由已知分布中有限训练资源显式控制。本综述遵循 PAC(可能近似正确)框架下的不可知主动采样理论,以模型不可知的有监督与无监督方式分析小数据学习的泛化误差与标签复杂度。考虑到多个学习社群可产生小数据表示且相关主题已有充分综述,我们因而补充小数据的新几何表示视角:欧氏与非欧氏(双曲)均值,其中给出并讨论了包括欧氏梯度、非欧氏梯度与 Stein 梯度在内的优化解。随后,总结了可能被小数据学习改进的多个学习社群,其产生数据高效表示,如迁移学习、对比学习、图表示学习。同时,我们发现元学习可为小数据学习提供有效的参数更新策略。接着,探讨了小数据的多个挑战性场景,如弱监督与多标签。最后,调研了可能受益于高效小数据表示的多个数据应用。
引用
@article{arxiv.2207.14443,
title = {A Survey of Learning on Small Data: Generalization, Optimization, and Challenge},
author = {Xiaofeng Cao and Weixin Bu and Shengjun Huang and Minling Zhang and Ivor W. Tsang and Yew Soon Ong and James T. Kwok},
journal= {arXiv preprint arXiv:2207.14443},
year = {2023}
}