来自鲁棒预训练的数据高效双赢彩票票
机器学习
2022-06-13 v1 人工智能
摘要
预训练作为各种下游任务迁移学习的广泛采用起点。近期对彩票票假设(LTH)的研究表明,此类庞大的预训练模型可被极稀疏子网络(即匹配子网络)替代而不损失可迁移性。然而,实际安全关键应用通常提出超越标准迁移的更具挑战性要求,也要求这些子网络克服对抗脆弱性。本文形式化了更严格的概念——双赢彩票票,其中从预训练模型定位的子网络可独立迁移至多样下游任务,在标准与对抗训练两种机制下,均达到与完整预训练模型相同的标准泛化与鲁棒泛化。我们全面考察多种预训练机制,发现鲁棒预训练倾向于雕琢更稀疏的双赢彩票票,其性能优于标准对应物。例如,在下游 CIFAR-10/100 数据集上,我们从 ImageNet 的标准、快速对抗和对抗预训练中分别以 89.26%/73.79%、89.26%/79.03% 和 91.41%/83.22% 的稀疏度识别出双赢匹配子网络。此外,我们观察到所获得的双赢彩票票在实际数据有限(如 1% 和 10%)的下游方案下迁移时更具数据效率。我们的结果表明,鲁棒预训练带来的益处被彩票票方案以及数据有限迁移设置所放大。代码可在 https://github.com/VITA-Group/Double-Win-LTH 获取。
引用
@article{arxiv.2206.04762,
title = {Data-Efficient Double-Win Lottery Tickets from Robust Pre-training},
author = {Tianlong Chen and Zhenyu Zhang and Sijia Liu and Yang Zhang and Shiyu Chang and Zhangyang Wang},
journal= {arXiv preprint arXiv:2206.04762},
year = {2022}
}
备注
Accepted by ICML 2022