TrajShield:面向文本到视频模型防御的轨迹级安全调解
计算机视觉与模式识别
2026-05-05 v1
摘要
文本到视频(Text-to-Video, T2V)模型在从自然语言提示生成具有时序一致性的视频方面展现出卓越能力,但也可能产生不安全内容,如暴力或色情内容。现有基于提示级别的防御方法基本继承自文本到图像安全防御,仅针对输入的词汇表面进行处理,易受到通过重新表述或对抗性提示掩盖有害意图的暴力破解攻击。此外,T2V 生成引入了一个被先前工作所忽视的独特挑战:时序性突发风险(temporally emergent risk),即看似良性的提示会因生成器对叙事连贯性的时序外推而导致不安全内容。我们提出 \method{},一种无需训练、基于推理的防御框架,将 T2V 安全问题重新表述为时序结构语义空间中的因果干预。TrajShield 通过模拟提示所暗示的轨迹、局部化潜在风险的因果来源,并应用最小侵入性的改写来中和风险,同时保留与安全无关的语义。实验在 T2VSafetyBench 上进行,覆盖 14 个安全类别和多个 T2V 后端,表明 TrajShield 在防御性能上实现了最先进水平,同时保持高语义保真度,显著优于现有防御方法,平均 ASR 降低 52.44%。
引用
@article{arxiv.2605.01761,
title = {TrajShield: Trajectory-Level Safety Mediation for Defending Text-to-Video Models Against Jailbreak Attacks},
author = {Quanchen Zou and Nizhang Li and Wenxin Zhang and Jiaye Lin and Yangchen Zeng and Xiangzheng Zhang and Zonghao Ying},
journal= {arXiv preprint arXiv:2605.01761},
year = {2026}
}