嘴唇在说谎:识别唇形同步 DeepFake 中音视频的时间不一致性
计算机视觉与模式识别
2024-10-29 v2
摘要
近年来,DeepFake 技术在高质量视频合成方面取得了前所未有的成功,但这些方法也给人类带来了潜在且严重的安全威胁。DeepFake 可分为换脸等娱乐应用和唇形同步欺诈等非法用途两类。然而,唇部伪造视频既不改变身份也没有明显的视觉伪影,对现有的 DeepFake 检测方法构成了严峻挑战。我们的初步实验表明,现有方法在处理唇形同步视频时,其有效性通常会急剧下降甚至失效。在本文中,我们首次提出了一种专门用于唇部伪造识别的新方法,该方法利用了唇部运动与音频信号之间的不一致性。我们还通过捕捉唇部与头部区域之间微妙的生物学联系来模拟人类自然认知,以提高准确性。为了更好地说明我们所提方法的有效性和先进性,我们利用最先进的唇部生成器创建了一个高质量的 LipSync 数据集 AVLips。我们希望这个高质量且多样化的数据集能很好地服务于这一充满挑战和有趣领域的进一步研究。实验结果表明,我们的方法在识别唇形同步视频方面的平均准确率超过 95.3%,显著优于基线方法。大量实验证明了该方法处理 DeepFake 的能力以及在经受各种输入变换时的鲁棒性。我们的方法在真实场景(如微信视频通话)中的准确率高达 90.2%,展现了其在真实场景部署中的强大能力。为了促进该研究社区的进步,我们在 https://github.com/AaronComo/LipFD 发布了所有资源。
引用
@article{arxiv.2401.15668,
title = {Lips Are Lying: Spotting the Temporal Inconsistency between Audio and Visual in Lip-Syncing DeepFakes},
author = {Weifeng Liu and Tianyi She and Jiawei Liu and Boheng Li and Dongyu Yao and Ziyou Liang and Run Wang},
journal= {arXiv preprint arXiv:2401.15668},
year = {2024}
}