中文

语言模型激活的对抗攻击缩放定律

机器学习 2023-12-06 v1 计算与语言 密码学与安全

摘要

我们探索了一类针对语言模型激活的对抗攻击。通过操控一个相对较小的模型激活子集 aa,我们展示了控制大量(某些情况下多达1000个)后续词元 tt 精确预测的能力。我们经验性地验证了一个缩放定律:可预测的最大目标词元数 tmaxt_\mathrm{max} 与攻击者控制其激活的词元数 aa 呈线性关系,即 tmax=κat_\mathrm{max} = \kappa a。我们发现,在输入空间中控制输出空间中单个比特所需的比特数(我们称之为攻击抵抗度 χ\chi)在不同语言模型的两个数量级模型规模上惊人地恒定在约16到约25之间。与针对词元的攻击相比,针对激活的攻击可预测地强得多,然而我们观察到一个惊人的规律性:通过激活或词元引导的一个输入比特能够对相似数量的输出比特施加控制。这支持了对抗攻击是输入和输出空间之间维度不匹配的结果这一假设。攻击语言模型激活而非词元的容易程度的一个实际意义在于多模态和选择性检索模型,其中额外的数据源直接作为激活添加,绕过了词元化输入。这开辟了一个新的、广泛的攻击面。通过使用语言模型作为可控的实验平台来研究对抗攻击,我们能够实验在计算机视觉中无法触及的输入-输出维度,尤其是在输出维度占主导的情况下。

关键词

引用

@article{arxiv.2312.02780,
  title  = {Scaling Laws for Adversarial Attacks on Language Model Activations},
  author = {Stanislav Fort},
  journal= {arXiv preprint arXiv:2312.02780},
  year   = {2023}
}

备注

15 pages, 9 figures