中文

通过场景分割策略对文本到视频模型进行越狱攻击

计算机视觉与模式识别 2026-05-20 v2 人工智能

摘要

随着众多文本到视频 (T2V) 模型的快速发展,日益增长的安全风险担忧也随之出现。虽然最近的研究通过越狱攻击探索了类似大语言模型 (LLM)、视觉语言模型 (VLM) 和文本到图像 (T2I) 模型的漏洞,但 T2V 模型仍基本未被探索,留下了显著的安全鸿沟。为填补这一鸿沟,我们引入了 SceneSplit,这是一种新型的黑箱越狱方法,通过将有害叙事分割为多个场景,每个场景本身都良性。该方法通过操控生成输出空间——给定提示的所有潜在视频输出集合——来实现,这种方法利用场景的组合作为强大的约束来引导最终结果。虽然每个场景对应一个广泛且安全的空间,其中大多数结果都是良性,但它们的顺序组合整体上限制了该空间,将其缩小到不安全的区域,并显著增加生成有害视频的可能性。通过迭代场景操控进一步增强了该核心机制,以绕过受限不安全区域内的安全过滤器。此外,一个策略库复用成功的攻击模式进一步提高了攻击的整体效果和鲁棒性。为验证我们的方法,我们在 T2V 模型上评估了 SceneSplit,该方法覆盖来自 T2VSafetyBench 的 11 个安全类别。我们的结果显示,在 Luma Ray2 上实现平均攻击成功率 (ASR) 为 77.2%,在 Hailuo 上为 84.1%,在 Veo2 上为 78.2%,在 Kling V1.0 上为 78.6%,在 Sora2 上为 68.6%,显著优于现有基线方法。通过本工作,我们表明当前的 T2V 安全机制对利用叙事结构实施的攻击具有脆弱性,为理解和改进 T2V 模型的安全性提供了新的见解。

关键词

引用

@article{arxiv.2509.22292,
  title  = {Jailbreaking on Text-to-Video Models via Scene Splitting Strategy},
  author = {Wonjun Lee and Haon Park and Doehyeon Lee and Bumsub Ham and Suhyun Kim},
  journal= {arXiv preprint arXiv:2509.22292},
  year   = {2026}
}

备注

ICLR 2026. Project page at https://velpegor.github.io/SceneSplit/