中文

T2VSafetyBench:评估文本到视频生成模型安全性

计算机视觉与模式识别 2024-09-10 v3 人工智能 计算与语言 密码学与安全 机器学习

摘要

Sora 的最新发展带来了文本到视频 (T2V) 生成的新时代。随之而来的就是其安全风险日益增加的担忧。生成的视频可能包含非法或不道德的内容,且缺乏对其安全性的全面定量理解,这对其可靠性和实际部署构成挑战。以往的评估主要关注视频生成的质量。虽然一些针对文本到图像模型的评估已考虑安全问题,但涵盖的方面较少,且未针对视频生成特有的时序风险。为弥合这一研究空白,我们引入 T2VSafetyBench,一个用于进行 safety-critical 评估的新基准。我们定义了文本到视频生成安全的 12 个关键方面,并构建了一个包含真实世界提示、LLM 生成提示和越狱攻击提示的恶意提示数据集。基于我们的评估结果,我们得出了几个重要发现,包括:1)没有单个模型在所有方面都表现突出,不同模型显示出各种优势;2)GPT-4 评估与人工审阅之间的相关性通常较高;3)文本到视频生成模型在可用性与安全性之间存在权衡。这表明随着视频生成领域的快速发展,安全风险将急剧上升,凸显了优先考虑视频安全的紧迫性。我们希望 T2VSafetyBench 为在生成式 AI 时代理解视频生成安全提供洞见。

关键词

引用

@article{arxiv.2407.05965,
  title  = {T2VSafetyBench: Evaluating the Safety of Text-to-Video Generative Models},
  author = {Yibo Miao and Yifan Zhu and Yinpeng Dong and Lijia Yu and Jun Zhu and Xiao-Shan Gao},
  journal= {arXiv preprint arXiv:2407.05965},
  year   = {2024}
}