中文

应对合成数据在在线持续学习中的污染问题

计算机视觉与模式识别 2024-11-22 v1 机器学习

摘要

图像生成在生成高保真逼真图像方面取得了显著进展,尤其是基于扩散模型的进步。然而,AI 生成图像的流行可能对机器学习社区产生未被明确识别的副作用。与此同时,深度学习在计算机视觉领域的成功得益于大规模收集的互联网数据集。大量合成数据被添加到互联网上,这将成为未来研究者收集“干净”数据集(无 AI 生成内容)的障碍。先前的研究表明,使用被合成图像污染的数据集进行训练可能导致性能下降。本文调查了受污染数据集对在线持续学习 (continual learning, CL) 研究的潜在影响。我们实验表明,受污染的数据集可能阻碍现有在线 CL 方法的训练。此外,我们提出了熵选择与实合成相似度最大化 (Entropy Selection with Real-synthetic similarity Maximization, ESRM) 方法,以缓解训练在线 CL 模型时由合成图像导致的性能下降。实验表明,我们的方法能显著缓解性能下降,尤其是在污染严重的情况下。为可重复性,本工作的源码已公开于 https://github.com/maorong-wang/ESRM。

关键词

引用

@article{arxiv.2411.13852,
  title  = {Dealing with Synthetic Data Contamination in Online Continual Learning},
  author = {Maorong Wang and Nicolas Michel and Jiafeng Mao and Toshihiko Yamasaki},
  journal= {arXiv preprint arXiv:2411.13852},
  year   = {2024}
}

备注

Accepted to NeurIPS'24