基于潜在聚类的数据降维高效半监督对抗训练
机器学习
2026-03-10 v4 人工智能
密码学与安全
计算机视觉与模式识别
摘要
在对抗环境下学习鲁棒模型被广泛认可为需要大量训练样本。最近的工作提出了半监督对抗训练 (SSAT),它利用外部未标记或合成生成数据,目前处于最先进水平。然而,SSAT 需要大量额外数据才能实现高鲁棒性,导致训练时间延长和内存使用增加。本文提出数据降维策略,以提高 SSAT 效率,通过优化额外数据采纳的数量。具体而言,我们设计了新的潜在聚类技术,用于选择或生成靠近模型决策边界的少量关键数据样本。虽然聚焦边界附近点,我们的方法保持边界和非边界数据点之间的平衡比例,从而避免过拟合。跨图像基准的全面实验表明,我们的方法能够有效降低 SSAT 的数据需求和计算成本,同时保持其强大的鲁棒性优势。特别是,我们基于 k-means 聚类的潜在空间选择方案和基于 LCG-KM 的引导扩散方法最为有效,在使用 5 倍到 10 倍更少的未标记数据的情况下,几乎实现了相同的 robust accuracy。与训练至收敛的完整 SSAT 相比,我们的方法因战略性优先选择未标记数据而将总运行时间缩短约 3 倍到 4 倍。
引用
@article{arxiv.2501.10466,
title = {Efficient Semi-Supervised Adversarial Training via Latent Clustering-Based Data Reduction},
author = {Somrita Ghosh and Yuelin Xu and Xiao Zhang},
journal= {arXiv preprint arXiv:2501.10466},
year = {2026}
}
备注
Shorter version of this work accepted by NextGenAISafety Workshop at ICML 2024