中文

预训练中通过对抗训练获得更好的表示:理论视角

机器学习 2024-01-30 v1 机器学习

摘要

预训练已知能够为大规模深度学习(如大语言模型)中的下游任务生成通用表示。现有文献(例如 \cite{kim2020adversarial})通过经验观察发现,下游任务可以继承预训练模型的对抗鲁棒性。我们为这种鲁棒性继承现象提供了理论论证。我们的理论结果表明,特征纯化在连接预训练模型与下游任务的对抗鲁棒性方面,在双层神经网络中发挥了重要作用。具体而言,我们表明:通过对抗训练,每个隐藏节点倾向于只选择一个(或少数几个)特征;而没有对抗训练时,隐藏节点可能容易受到攻击。这一观察对于监督预训练和对比学习均成立。结果表明,有了纯化后的节点,仅通过干净训练就足以在下游任务中实现对抗鲁棒性。

关键词

引用

@article{arxiv.2401.15248,
  title  = {Better Representations via Adversarial Training in Pre-Training: A Theoretical Perspective},
  author = {Yue Xing and Xiaofeng Lin and Qifan Song and Yi Xu and Belinda Zeng and Guang Cheng},
  journal= {arXiv preprint arXiv:2401.15248},
  year   = {2024}
}

备注

To appear in AISTATS2024