中文

数据毒化攻击何时、何地影响文本倒插?

密码学与安全 2025-09-04 v4 人工智能

摘要

数据毒化攻击构成扩散模型(diffusion models, DMs)鲁棒性的重大挑战。本文系统性地分析了数据毒化攻击如何作用于文本倒插(textual inversion, TI),后者是扩散模型中广泛使用的个人化技术。我们首先引入语义敏感图(Semantic Sensitivity Maps),以可视化方法展示毒化对文本嵌入的影响。其次,我们识别并实验验证扩散模型在不同时间步上表现出非均匀的学习行为,聚焦于低噪声样本。数据毒化攻击继承了这一偏差,并在低时间步注入对抗信号。最后,我们观察到对抗信号会分散学习,使其偏离训练数据中与相关概念相关的区域,从而损坏 TI 的过程。基于这些洞见,我们提出了安全区训练(Safe-Zone Training, SZT),一种新型防御机制,包含三个关键组件:(1)JPEG 压缩以削弱高频毒化信号;(2)在 TI 训练中限制使用高时间步,以避免低时间步的对抗信号;(3)损失掩码以约束学习局部于相关区域。跨越多种毒化方法的广泛实验表明,SZT 大幅提升了 TI 针对所有数据毒化攻击的鲁棒性,超越了已发表的先前防御措施在生成质量方面的表现。代码:https://www.github.com/JStyborski/Diff_Lab;数据:https://www.github.com/JStyborski/NC10

关键词

引用

@article{arxiv.2507.10578,
  title  = {When and Where do Data Poisons Attack Textual Inversion?},
  author = {Jeremy Styborski and Mingzhi Lyu and Jiayou Lu and Nupur Kapur and Adams Kong},
  journal= {arXiv preprint arXiv:2507.10578},
  year   = {2025}
}

备注

Accepted to ICCV 2025