SAFLEX:基于特征标签外推的自适应数据增强
机器学习
2024-10-04 v1 人工智能
摘要
数据增强是深度学习中的核心技术,对提升模型性能尤其在标注数据稀缺的情况下至关重要。虽然传统技术有效,但依赖人工设计的方式限制了其在不同数据类型和任务上的适用性。尽管现代可学习的数据增强方法提供了更大的灵活性,但计算成本高昂且难以融入主流的增强工作流程。本文提出了一种新颖且高效的数据增强方法,有效地弥合了现有增强策略与新兴数据集和学习任务之间的差距。我们引入 SAFLEX(Self-Adaptive Augmentation via Feature Label EXtrapolation),通过专门设计的高效双层优化算法,学习来自任何给定上游增强管道提供的增强样本的权重和软标签。令人惊讶的是,SAFLEX 在仅增加微小计算成本的情况下,有效减少了上游增强管道中的噪声和标签错误。作为一个通用的模块,SAFLEX 在包括自然图像、医学图像和表格数据在内的多种数据集上表现出色,展现了在少样本学习和分布外推 generalization 方面的强项。SAFLEX 无缝集成了诸如 RandAug、CutMix 以及来自大型预训练生成模型(如 stable diffusion)的增强策略,并与 CLIP 微调等框架兼容。我们的发现表明,为新数据类型和任务适配现有的增强管道具有潜力,指向更具可适应性和韧性的训练框架的发展方向。
引用
@article{arxiv.2410.02512,
title = {SAFLEX: Self-Adaptive Augmentation via Feature Label Extrapolation},
author = {Mucong Ding and Bang An and Yuancheng Xu and Anirudh Satheesh and Furong Huang},
journal= {arXiv preprint arXiv:2410.02512},
year = {2024}
}
备注
ICLR 2024