中文

TEAR:面向文本到视频模型的时序感知自动化红队测试框架

计算机视觉与模式识别 2026-03-12 v2

摘要

文本到视频(T2V)模型能够合成高质量、时序一致的动态视频内容,但其多样化的生成也固有地引入了严峻的安全挑战。现有的安全评估方法侧重于静态图像和文本生成,无法捕捉视频生成中复杂的时序动态。为此,我们提出了TEmporal-aware Automated Red-teaming框架,命名为TEAR,是一个专为揭示T2V模型与动态时序序列相关的安全风险而设计的自动化框架。TEAR采用时序感知测试生成器,通过初始生成器训练和时序感知在线偏好学习两个阶段进行优化,以生成能利用时序动态特性以触发政策违规视频输出的文本无害提示。同时,采用一种精炼模型来循环式提高提示的隐蔽性和对抗有效性。广泛的实验评估表明,TEAR在开源和商业T2V系统中均表现出色,攻击成功率超过80%,显著高于先前最佳结果的57%。

关键词

引用

@article{arxiv.2511.21145,
  title  = {TEAR: Temporal-aware Automated Red-teaming for Text-to-Video Models},
  author = {Jiaming He and Guanyu Hou and Hongwei Li and Zhicong Huang and Kangjie Chen and Yi Yu and Wenbo Jiang and Guowen Xu and Tianwei Zhang},
  journal= {arXiv preprint arXiv:2511.21145},
  year   = {2026}
}

备注

CVPR 2026