中文

通过对抗视角理解线性模型在Transformer中的类因学习

机器学习 2025-08-07 v2 密码学与安全

摘要

本文对Transformer中线性模型的类因学习做出了两个贡献。首先,我们研究了Transformer中类因学习对劫持攻击的对抗鲁棒性——这是一类旨인操纵提示以迫使Transformer生成特定输出的对抗攻击。我们表明,无论是线性Transformer还是采用GPT-2架构的Transformer都容易受到此类劫持攻击的威胁。然而,通过对抗训练(无论是在预训练还是微调阶段)可显著提高对此类攻击的鲁棒性,并且能泛化到更强的攻击模型。我们的第二个主要贡献是对抗脆弱性在Transformer模型与其他线性模型学习算法之间的比较分析。这揭示了两个新发现。首先,尽管在分布内性能相似,较大规模的Transformer模型根据不同随机种子训练的模型之间仍然难以转移对抗攻击。这表明相同架构的Transformer按照相同配方训练可能为相同任务实现不同的类因学习算法。其次,我们观察到,对抗攻击在经典线性模型学习算法(单步梯度下降和普通最小二乘)与Transformer之间转移效果不佳。这表明Transformer实现的类因学习算法可能与这些传统算法存在定性差异。

关键词

引用

@article{arxiv.2411.05189,
  title  = {Understanding In-Context Learning of Linear Models in Transformers Through an Adversarial Lens},
  author = {Usman Anwar and Johannes Von Oswald and Louis Kirsch and David Krueger and Spencer Frei},
  journal= {arXiv preprint arXiv:2411.05189},
  year   = {2025}
}

备注

Transactions on Machine Learning Research (TMLR) 2025, with Featured Certification