RunawayEvil: 图像到视频生成模型的越狱攻击
计算机视觉与模式识别
2025-12-09 v1
摘要
图像到视频(I2V)生成从图像和文本输入中合成动态视觉内容,提供显著的创意控制。然而,此类多模态系统的安全性,特别是其对越狱攻击的脆弱性,仍未得到充分探索。为弥补这一空白,我们提出 RunawayEvil,这是首个具备动态演化能力的多模态 I2V 模型越狱框架。基于"策略-战术-行动"范式,我们的框架通过三个核心组件展现自增强攻击能力:(1) 策略感知指令单元,通过强化学习驱动的策略定制和基于大语言模型的策略探索,使攻击能够自我演化其策略;(2) 多模态战术规划单元,根据所选策略生成协调的文本越狱指令和图像篡改指南;(3) 战术行动单元,执行并评估多模态协调攻击。这种自演化架构使框架能够在无需人工干预的情况下持续适应并强化其攻击策略。大量实验表明,RunawayEvil 在商业 I2V 模型(如 Open-Sora 2.0 和 CogVideoX)上达到了最先进的攻击成功率。具体而言,RunawayEvil 在 COCO2017 上比现有方法高出 58.5% 至 79%。本工作为 I2V 模型的漏洞分析提供了关键工具,从而为更鲁棒的视频生成系统奠定了基础。
引用
@article{arxiv.2512.06674,
title = {RunawayEvil: Jailbreaking the Image-to-Video Generative Models},
author = {Songping Wang and Rufan Qian and Yueming Lyu and Qinglong Liu and Linzhuang Zou and Jie Qin and Songhua Liu and Caifeng Shan},
journal= {arXiv preprint arXiv:2512.06674},
year = {2025}
}