中文

有效且鲁健的对抗训练:针对数据与标签损坏

机器学习 2024-05-08 v1 计算机视觉与模式识别

摘要

由于数据扰动和标签噪声导致的损坏在来自不可靠来源的数据集中十分常见,这对模型训练构成严重威胁。尽管已有努力开发鲁健模型,但当前学习方法常常忽视这两种损坏可能同时存在的可能性,限制了模型的有效性和实用性。本文开发了一种有效且鲁健的对抗训练(ERAT)框架,以无需先验知识地方式同时处理这两种损坏。我们提出了一种围绕多个潜在对抗扰动的混合对抗训练方法,同时基于类别再平衡样本选择的半监督学习,以增强模型对双重损坏的鲁健性。一方面,在所提对抗训练中,扰动生成模块以深度神经网络模型为受害者,学习多个模拟的恶意数据扰动,而模型被训练在原始数据和混合扰动数据之间保持语义一致性。预期可使模型应对现实世界数据损坏中不可预测的扰动。另一方面,设计了一种类别再平衡数据选择策略,以公正地区分干净标签和噪声标签。随后进行半监督学习,通过丢弃噪声标签实现。大量实验表明,所提出的ERAT框架优于现有方法。

关键词

引用

@article{arxiv.2405.04191,
  title  = {Effective and Robust Adversarial Training against Data and Label Corruptions},
  author = {Peng-Fei Zhang and Zi Huang and Xin-Shun Xu and Guangdong Bai},
  journal= {arXiv preprint arXiv:2405.04191},
  year   = {2024}
}

备注

12 pages, 8 figures