中文

病毒感染攻击:合成数据上的LLM投毒可“通过”传播

密码学与安全 2025-10-27 v2 人工智能 计算与语言

摘要

合成数据指由模型生成的人工样本。虽然已验证合成数据在训练大语言模型(LLM)期间显著提升性能,并在LLM开发中得到广泛采用,但其可能引入的潜在安全风险尚未受到调查。本文系统评估了合成数据集成训练范式对LLM抗性的韧性,针对主流的投毒攻击和后门攻击。我们揭示,该范式对现有攻击具有强大的抵抗力,主要归因于投毒数据与用于生成合成样本的查询之间存在不同的分布模式。为提高攻击效果并进一步调查合成数据引入的安全风险,我们引入一种新型通用攻击框架,即病毒感染攻击(VIA),该框架即使在仅使用干净查询的情况下,也能通过合成数据传播当前攻击。灵感来自网络安全中病毒设计的原理,VIA将投毒载荷置于 protective “壳”中,并战略性地搜索在良性样本中寻找最佳劫持点,以最大化生成恶意内容的可能性。广泛的实验在数据投毒和后门攻击上表明,VIA显著增加了合成数据中投毒内容的出现频率,相应地将下游模型的攻击成功率(ASR)提升至与受投毒上游模型相当的水平。

关键词

引用

@article{arxiv.2509.23041,
  title  = {Virus Infection Attack on LLMs: Your Poisoning Can Spread "VIA" Synthetic Data},
  author = {Zi Liang and Qingqing Ye and Xuan Liu and Yanyun Wang and Jianliang Xu and Haibo Hu},
  journal= {arXiv preprint arXiv:2509.23041},
  year   = {2025}
}

备注

Camera Ready of NeurIPS 2025 Spotlight. Source code: https://github.com/liangzid/VirusInfectionAttack