T2VShield:面向文本到视频模型的模型无关越狱防御
密码学与安全
2025-04-29 v2 机器学习
摘要
生成式人工智能的快速发展使得文本到视频模型成为构建未来多模态世界模拟器的关键。然而,这些模型仍然容易受到越狱攻击,即特制的提示词可以绕过安全机制,导致生成有害或不安全的内容。此类漏洞削弱了基于模拟的应用的可靠性和安全性。在本文中,我们提出了 T2VShield,一个全面且模型无关的防御框架,旨在保护文本到视频模型免受越狱威胁。我们的方法系统地分析了输入、模型和输出阶段,以识别现有防御的局限性,包括提示词中的语义歧义、动态视频输出中恶意内容检测的困难以及不灵活的以模型为中心的缓解策略。T2VShield 引入了一种基于推理和多模态检索的提示词重写机制来净化恶意输入,以及一个多范围检测模块,用于捕获跨时间和模态的局部和全局不一致性。该框架不需要访问内部模型参数,适用于开源和闭源系统。在五个平台上的大量实验表明,与强基线相比,T2VShield 可以将越狱成功率降低高达 35%。我们进一步开发了一个以人为中心的视听评估协议来评估感知安全性,强调了视觉级防御在增强下一代多模态模拟器可信度方面的重要性。
引用
@article{arxiv.2504.15512,
title = {T2VShield: Model-Agnostic Jailbreak Defense for Text-to-Video Models},
author = {Siyuan Liang and Jiayang Liu and Jiecheng Zhai and Tianmeng Fang and Rongcheng Tu and Aishan Liu and Xiaochun Cao and Dacheng Tao},
journal= {arXiv preprint arXiv:2504.15512},
year = {2025}
}
备注
33 pages, 9 figures