中文

Q-FAKER:基于受控生成的查询-free 硬黑箱攻击

密码学与安全 2025-04-21 v1 人工智能 计算与语言

摘要

许多对抗攻击方法被提出以验证语言模型的脆弱性。然而,这些方法需要大量查询且需要目标模型的信息。即便是最近的硬黑箱攻击方法,也需要许多查询并需要极高的对抗生成器训练成本。在面对目标模型闭合且不可访问的硬黑箱场景时,这些方法并不适用。为此,我们提出 Q-faker(Query-free Hard Black-box Attacker),一种 novel 且高效的方法,可在不访问目标模型的情况下生成对抗样本。为避免访问目标模型,我们使用替代模型。替代模型为目标无关攻击生成对抗句子。在此过程中,我们利用受控生成技术。我们在八个数据集上评估了我们的方法。实验结果表明,我们的方法在高置换性、生成对抗样本的高质量方面表现出色,并证明其在硬黑箱场景中的实用性。

关键词

引用

@article{arxiv.2504.13551,
  title  = {Q-FAKER: Query-free Hard Black-box Attack via Controlled Generation},
  author = {CheolWon Na and YunSeok Choi and Jee-Hyong Lee},
  journal= {arXiv preprint arXiv:2504.13551},
  year   = {2025}
}

备注

NAACL 2025 Findings