面向对抗扰动的低秩适应
机器学习
2026-05-01 v1 密码学与安全
摘要
低秩适应(Low-Rank Adaptation, LoRA)利用了模型更新通常位于低维空间的洞察,通过使用低秩矩阵更新神经网络层,显著提高了大型语言模型(LLMs)的训练效率。由于对抗样本的生成是一个类似于模型训练的优化过程,这自然引出一个问题:对抗扰动是否也表现出类似的低秩结构?在本文中,我们通过跨多种攻击方法、模型架构和数据集的理论分析与广泛实证研究,证明对抗扰动确实具有固有的低秩结构。这一洞察为提高对抗攻击和防御的效率与效果开辟了新机遇。我们主要关注利用这种低秩特性来提高黑盒对抗攻击的效率和有效性,这类攻击通常面临查询次数过多的问题。我们的方法遵循两步策略。首先,我们使用一个参考模型和辅助数据来引导梯度投影到一个低维子空间。接着,我们将黑盒攻击中的扰动搜索限制在这个低秩子空间内,从而显著提高对抗攻击的效率和效果。我们在一系列攻击方法、基准模型、数据集和威胁模型上评估了我们的方法。结果表明,与传统方法相比,我们的低秩对抗攻击在性能上取得了显著且一致的提升。
引用
@article{arxiv.2604.27487,
title = {Low Rank Adaptation for Adversarial Perturbation},
author = {Han Liu and Shanghao Shi and Yevgeniy Vorobeychik and Chongjie Zhang and Ning Zhang},
journal= {arXiv preprint arXiv:2604.27487},
year = {2026}
}