中文

CtrlAttack:面向扩散模型世界模型控制的统一攻击

计算机视觉与模式识别 2026-03-17 v1 人工智能 密码学与安全

摘要

基于扩散的图像到视频(image-to-video, I2V)模型日益展现出类世界模型(world-model)的特性,通过隐式捕获时间动力学。然而,现有研究主要关注视觉质量和可控性,模型学习的状态转移鲁健性仍未得到充分考察。为填补此 gap,本文首次分析 I2V 模型的脆弱性,发现时间控制机制构成了新的攻击面,揭示了在不同攻击设置下对其建模的挑战。基于此,我们提出一种轨迹控制攻击,称为 CtrlAttack,通过干扰生成过程中的状态演化。具体而言,我们将扰动表示为低维速度场,通过时间积分构建连续位移场,从而在保持时间一致性的同时影响模型的状态转移;同时,我们将扰动映射到观测空间,使方法适用于白盒和黑盒攻击设置。实验结果表明,即使在低维和强正则化扰动约束下,本方法仍能显著干扰时间一致性,将攻击成功率(ASR)在白盒设置下提升至 90% 以上,在黑盒设置下提升至 80% 以上,而 FID 和 FVD 的变化分别保持在 6 和 130 以内,揭示了 I2V 模型在状态动力学层面的潜在安全风险。

关键词

引用

@article{arxiv.2603.13435,
  title  = {CtrlAttack: A Unified Attack on World-Model Control in Diffusion Models},
  author = {Shuhan Xu and Siyuan Liang and Hongling Zheng and Yong Luo and Han Hu and Lefei Zhang and Dacheng Tao},
  journal= {arXiv preprint arXiv:2603.13435},
  year   = {2026}
}