对抗性预训练的转换器可能成为通用鲁棒的零样本学习者
机器学习
2026-03-03 v3 计算机视觉与模式识别
机器学习
摘要
对抗性训练是防御对抗性攻击的最有效方法之一,但其计算成本高昂。本研究提出了首个理论分析,表明对抗性预训练的转换器可作为通用鲁棒基础模型——即能够仅通过轻量调优即可适应 diverse downstream 任务的模型。具体而言,我们证明,在多种分类任务上进行对抗性预训练后的单层线性转换器,能够通过仅使用干净演示进行零样本学习,从而对 unseen classification 任务实现鲁棒泛化(无需额外对抗性训练或示例)。这种普遍鲁棒性源于模型自适应聚焦于给定任务中鲁棒特征的能力。我们还识别了两大实现鲁棒性的挑战:准确率与鲁棒性之间的权衡,以及样本密集型训练。本研究启动了讨论通用鲁棒基础模型的实用价值。虽然其训练成本高昂,但投资值得,因为下游任务可免费获得对抗性鲁棒性。代码已公开于 https://github.com/s-kumano/universally-robust-in-context-learner。
引用
@article{arxiv.2505.14042,
title = {Adversarially Pretrained Transformers May Be Universally Robust In-Context Learners},
author = {Soichiro Kumano and Hiroshi Kera and Toshihiko Yamasaki},
journal= {arXiv preprint arXiv:2505.14042},
year = {2026}
}
备注
ICLR26