当世界模型误判:基于物理条件的对抗性攻击
机器学习
2026-02-24 v1
摘要
生成式世界模型 (WM) 越来越多地用于合成可控的、感知条件驱动的驾驶视频,但其对物理先验的依赖暴露了新的攻击面。本文提出物理条件驱动世界模型攻击 (PhysCond-WMA),这是一种首次实现的白盒世界模型攻击,通过扰动物理条件通道(如 HDMap 嵌入和 3D 盒特征)来引发语义、逻辑或决策层面的扭曲,同时保持感知保真度。PhysCond-WMA 在两个阶段中进行优化:(1) 质量保持指导阶段约束反扩散损失低于校准阈值;(2) 动量引导去噪阶段沿去噪轨迹累积目标对齐梯度,以实现稳定、持续时间一致的语义位移。大量实验结果表明,我们的方法在保持 FID 平均提高约 9%、FVD 平均提高约 3.9%的同时仍有效。 在定向攻击设置下,攻击成功率 (ASR) 可达 0.55。下游研究进一步显示,在受攻击视频用于训练时,3D 检测性能约下降 4%,而开放环路规划性能恶化约 20%。这些发现首次揭示并量化了生成式世界模型中的安全漏洞,推动了更全面的安全检查器的开发。
引用
@article{arxiv.2602.18739,
title = {When World Models Dream Wrong: Physical-Conditioned Adversarial Attacks against World Models},
author = {Zhixiang Guo and Siyuan Liang and Andras Balogh and Noah Lunberry and Rong-Cheng Tu and Mark Jelasity and Dacheng Tao},
journal= {arXiv preprint arXiv:2602.18739},
year = {2026}
}