中文

SYNAuG:利用合成数据解决数据不平衡问题

计算机视觉与模式识别 2024-04-26 v3 机器学习

摘要

训练数据中的不平衡常导致训练模型产生偏倚预测,进而引发伦理与社会问题。一种直接的解决方案是精心整理训练数据,但鉴于现代神经网络的巨大规模,这种做法人力成本过高因而不可行。受生成模型近期进展的启发,本文探索了利用合成数据解决数据不平衡问题的潜力。具体而言,我们提出的方法称为 SYNAuG,其借助合成数据来均衡训练数据的不平衡分布。我们的实验表明,尽管真实与合成数据间存在域差距,但先使用 SYNAuG 训练再辅以少量真实样本微调,可在具有不同数据不平衡问题的多样任务上取得令人印象深刻的性能,超越已有的同目的任务专用方法。

关键词

引用

@article{arxiv.2308.00994,
  title  = {SYNAuG: Exploiting Synthetic Data for Data Imbalance Problems},
  author = {Moon Ye-Bin and Nam Hyeon-Woo and Wonseok Choi and Nayeong Kim and Suha Kwak and Tae-Hyun Oh},
  journal= {arXiv preprint arXiv:2308.00994},
  year   = {2024}
}

备注

The paper is under consideration at Pattern Recognition Letters