REPRINT:一种基于主成分的随机外推数据增强方法
计算与语言
2024-12-11 v2
摘要
数据稀缺与数据不平衡在许多领域备受关注。数据增强作为应对这些问题的有效途径,可通过生成新样本提升分类模型的鲁棒性与效率。本文提出REPRINT,一种简单而有效的用于不平衡数据分类的隐空间数据增强方法。给定每个类别样本的隐空间表示,REPRINT以随机方式,利用由主成分张成的子空间来概括源类与目标类的分布结构,为目标类外推增强样本。因此,生成的样本将在保持目标分布原始几何结构的同时使目标类多样化。此外,该方法包含一个标签精炼组件,可为增强样本合成新的软标签。在四个文本分类基准的一系列数据不平衡场景下,与不同的NLP数据增强方法相比,REPRINT展现出显著改进。而且,通过全面的消融研究,我们表明对于增强样本,标签精炼优于标签保持,且我们的方法在合适的主成分选择下表现出稳定而一致的改进。此外,REPRINT因其仅含一个决定子空间维度的超参数且所需计算资源低而易于使用。
引用
@article{arxiv.2204.12024,
title = {Reprint: a randomized extrapolation based on principal components for data augmentation},
author = {Le Li and Jiale Wei and Pai Peng and Qiyuan Chen and Benjamin Guedj and Bo Cai},
journal= {arXiv preprint arXiv:2204.12024},
year = {2024}
}