超越人脸的视频操控:一个含人机分析的数据集
计算机视觉与模式识别
2022-12-09 v3 人工智能
多媒体
摘要
随着内容编辑工具的成熟以及基于人工智能(AI)的媒体合成算法的发展,在线媒体中操控内容的存在日益增多。这一现象导致错误信息的传播,使得区分“真实”与“操控”内容的需求更加迫切。为此,我们提出 VideoSham,一个包含 826 个视频(413 个真实与 413 个操控)的数据集。许多现有的 deepfake 数据集仅关注两类面部操控——用不同主体的脸替换或改动现有脸部。相比之下,VideoSham 包含更丰富多样、语境丰富且以人为中心的高分辨率视频,这些视频使用 6 种不同的空间与时间攻击组合进行操控。我们的分析表明,最先进的操控检测算法仅对少数特定攻击有效,且在 VideoSham 上泛化不佳。我们在 Amazon Mechanical Turk 上对 1200 名参与者进行了用户研究,以了解他们能否区分 VideoSham 中的真实与操控视频。最后,我们深入剖析人类与 SOTA 算法表现的优劣,以识别需由更优 AI 算法填补的差距。我们在 https://github.com/adobe-research/VideoSham-dataset 发布该数据集。
引用
@article{arxiv.2207.13064,
title = {Video Manipulations Beyond Faces: A Dataset with Human-Machine Analysis},
author = {Trisha Mittal and Ritwik Sinha and Viswanathan Swaminathan and John Collomosse and Dinesh Manocha},
journal= {arXiv preprint arXiv:2207.13064},
year = {2022}
}
备注
Accepted to WACV2023 - Workshop on Manipulation, Adversarial, and Presentation Attacks in Biometrics