T2V-OptJail:文本到视频越狱攻击的离散提示优化
计算机视觉与模式识别
2025-06-18 v2
摘要
近年来, fueled by the rapid advancement of diffusion models, text-to-video (T2V) 生成模型取得了显著进展,包括Pika、Luma、Kling和Open-Sora等。尽管这些模型展现了惊人的生成能力,但也因对越狱攻击的脆弱性暴露了显著安全风险,攻击者可操控模型生成不安全内容,如色情、暴力或歧视内容。现有工作如T2VSafetyBench提供了安全评估的初步基准,但缺乏系统方法来彻底探索模型漏洞。为填补这一空白,我们首次将T2V越狱攻击形式化为离散优化问题,提出联合目标优化框架,称为T2V-OptJail。该框架包含两个关键优化目标:绕过内置安全过滤机制以提高攻击成功率,保持对抗提示与不安全输入提示之间的语义一致性,以及保持生成视频与不安全输入提示之间的语义一致性,以增强内容可控性。此外,我们引入一种由提示变体引导的迭代优化策略,在每一轮中生成多个语义等价候选方案,并聚合其评分,以稳健地引导搜索以获得最优对抗提示。我们在多个T2V模型上进行大规模实验,涵盖开源模型和商业闭源模型。实验结果表明,所提方法在依据GPT-4评估的攻击成功率和依据人类评估员评估的攻击成功率上分别优于现有最先进方法提高了11.4%和10.0%,验证了该方法在攻击有效性和内容可控性方面的显著优势。
引用
@article{arxiv.2505.06679,
title = {T2V-OptJail: Discrete Prompt Optimization for Text-to-Video Jailbreak Attacks},
author = {Jiayang Liu and Siyuan Liang and Shiqian Zhao and Rongcheng Tu and Wenbo Zhou and Aishan Liu and Dacheng Tao and Siew Kei Lam},
journal= {arXiv preprint arXiv:2505.06679},
year = {2025}
}