中文

高性能计算下的可卸载样本学习规模化

机器学习 2025-01-13 v1 人工智能 分布式、并行与集群计算

摘要

近期AI模型的进展旨在保留用户交互,可能不慎包含敏感医疗数据。在医疗领域,尤其是当放射科医生使用托管于在线平台的AI诊断工具时,医学影像数据可能被用于未来的AI训练而无需明确同意,这凸显了医疗数据使用的隐私和知识产权问题。针对这些隐私挑战,一种新方法——可卸载样本(Unlearnable Examples, UEs)——被引入,旨在使数据对深度学习模型不可被学习。该领域的著名方法之一称为“可卸载聚类”(Unlearnable Clustering, UC),在大批量大小下表现更佳,但受限于计算资源。为突破UE性能的极限(理论上资源无限),我们在Summit超级计算机上使用分布式数据并行(DDP)训练,扩展了UC学习至多个数据集。我们的目标是探索在高性能计算(HPC)水平下UE的有效性,以防止未授权的学习并提升数据安全性,尤其研究批量大小对UE不可学习性的影响。利用Summit的强大计算能力,我们在多样化数据集(如 Pets、MedMNist、Flowers、Flowers102)上开展了广泛实验。我们的发现表明,过大或过小的批量大小都会导致性能不稳定并影响准确率。然而,批量大小与不可学习性之间的关系在不同数据集之间存在差异,这凸显了为实现最佳数据保护所需针对每个数据集采用特定的批量大小策略。我们的结果强调,必须根据数据集的特定特征选择合适的批量大小,以防止学习并确保深度学习应用中的数据安全。

关键词

引用

@article{arxiv.2501.06080,
  title  = {Scale-up Unlearnable Examples Learning with High-Performance Computing},
  author = {Yanfan Zhu and Issac Lyngaas and Murali Gopalakrishnan Meena and Mary Ellen I. Koran and Bradley Malin and Daniel Moyer and Shunxing Bao and Anuj Kapadia and Xiao Wang and Bennett Landman and Yuankai Huo},
  journal= {arXiv preprint arXiv:2501.06080},
  year   = {2025}
}