透过 Deepfake 看多元宇宙:面向以人为中心的视觉与概念操纵的 MultiFakeVerse 数据集
多媒体
2025-06-17 v2 计算机视觉与模式识别
摘要
过去几年间,生成式人工智能技术的快速发展极大地推动了高度逼真的 deepfake 内容生成。尽管不断有研究致力于此,研究界仍然缺乏一个大规模且由推理能力驱动、专门针对以人为中心的对象、上下文和场景操纵的 deepfake 基准数据集。在本文中,我们通过引入 MultiFakeVerse 来填补这一空白,这是一个大规模以人为中心的 deepfake 数据集,包含 845,286 张图像,这些图像是通过操纵建议和图像操纵生成的,两者均源自视觉语言模型。VLM 指令专门针对修改场景中影响人类对重要性、意图或叙事感知的个体或上下文元素。这种 VLM 驱动的方法能够实现语义上的、上下文感知的修改,例如修改动作、场景和人-物交互,而不是现有数据集中常见的合成或低级身份交换以及特定区域的编辑。我们的实验表明,当前最先进的 deepfake 检测模型和人类观察者都难以检测出这些微妙但有意义的操纵。代码和数据集可在 GitHub 上获取。
引用
@article{arxiv.2506.00868,
title = {Multiverse Through Deepfakes: The MultiFakeVerse Dataset of Person-Centric Visual and Conceptual Manipulations},
author = {Parul Gupta and Shreya Ghosh and Tom Gedeon and Thanh-Toan Do and Abhinav Dhall},
journal= {arXiv preprint arXiv:2506.00868},
year = {2025}
}