你真的是那个意思吗?面向时序伪造定位的内容驱动音视频深度伪造数据集与多模态方法
计算机视觉与模式识别
2023-05-25 v2
摘要
由于其巨大的社会影响,深度伪造检测正受到计算机视觉界的积极关注。大多数深度伪造检测方法依赖于身份、面部属性以及基于对抗扰动的时空修改,作用于整段视频或随机位置,同时保持内容含义不变。然而,一个复杂的深度伪造可能仅包含一小段视频/音频篡改,借此内容的含义可从情感角度被完全反转。我们引入了一个内容驱动的音视频深度伪造数据集,称为局部化音视频深度伪造(LAV-DF),专为学习时序伪造定位任务而设计。具体而言,内容驱动的音视频篡改被策略性地执行以改变整段视频的情感极性。我们用于对所提数据集进行基准测试的基线方法是一个3DCNN模型,称为边界感知时序伪造检测(BA-TFD),其通过对比、边界匹配与帧分类损失函数进行引导。我们广泛的定量与定性分析展示了所提方法在时序伪造定位与深度伪造检测任务上的强劲性能。
引用
@article{arxiv.2204.06228,
title = {Do You Really Mean That? Content Driven Audio-Visual Deepfake Dataset and Multimodal Method for Temporal Forgery Localization},
author = {Zhixi Cai and Kalin Stefanov and Abhinav Dhall and Munawar Hayat},
journal= {arXiv preprint arXiv:2204.06228},
year = {2023}
}
备注
DICTA 2022