中文

探索不安全视频生成

密码学与安全 2024-07-18 v1 人工智能 计算机视觉与模式识别 计算机与社会

摘要

视频生成模型(VGMs)已显示出合成高质量输出的能力。理解这些模型生成不安全内容(如暴力或恐怖视频)的潜力至关重要。本 work 提供了对不安全视频生成的全面理解。首先,为确认这些模型确实可能生成不安全视频,我们选取了来自 4chan 和 Lexica 的不安全内容生成提示,以及三个开源最先进(SOTA)VGMs 来生成不安全视频。经过过滤重复和质量较差的内容后,我们从原始池中 5607 个视频中创建了初始的 2112 个不安全视频。通过对这些生成视频进行聚类和主题编码分析,我们识别出 5 类不安全视频:变形/怪诞、恐怖、色情、暴力/血腥和政治。获得 IRB 批准后,我们邀请线上参与者帮助标注生成的视频。基于 403 名参与者提交的标注,我们从初始视频集合中识别出 937 个不安全视频。有了这些标注信息和相应的提示,我们创建了由 VGM 生成的第一个不安全视频数据集。我们随后研究了防止生成不安全视频的可能防御机制。现有方法在图像生成中侧重于过滤输入提示或输出结果。我们提出了一种新方法称为潜在变量防御(LVD),其在模型内部采样过程中工作。LVD 在采样大量不安全提示时,可实现 0.90 的防御准确率,同时将时间和计算资源降低约10倍。

关键词

引用

@article{arxiv.2407.12581,
  title  = {Towards Understanding Unsafe Video Generation},
  author = {Yan Pang and Aiping Xiong and Yang Zhang and Tianhao Wang},
  journal= {arXiv preprint arXiv:2407.12581},
  year   = {2024}
}

备注

18 pages