GLCF:用于说话人脸生成检测的全局-局部多模态一致性分析框架
计算机视觉与模式识别
2025-02-25 v2
摘要
说话人脸生成(TFG)技术仅需面部图像及 accompanying 文本即可生成逼真的任意角色说话视频。滥用该技术可能对社会造成重大风险,亟需研究相应的检测方法。然而,该领域的研究因缺乏公开数据集而受阻。本文构建了首个大规模多场景说话人脸数据集(MSTF),包含 22 种音视频伪造技术,填补了该领域数据集的空白。该数据集涵盖 11 种生成场景和 20 余种语义场景,更贴近 TFG 的实际应用场景。此外,我们还提出了一种 TFG 检测框架,该框架利用 TFG 视频多模态内容中全局和局部一致性的分析。因此,引入了区域聚焦平滑度检测模块(RSFDM)和差异捕获时间帧聚合模块(DCTAM)来评估 TFG 视频的全局时间一致性,并聚合多粒度空间信息。另外,设计了视觉-音频融合模块(V-AFM)以评估局部时间视角下的视听一致性。综合实验证明了我们数据集的合理性与挑战性,同时也表明与 SOTA deepfake 检测方法相比,我们所提方法具有优越性。
引用
@article{arxiv.2412.13656,
title = {GLCF: A Global-Local Multimodal Coherence Analysis Framework for Talking Face Generation Detection},
author = {Xiaocan Chen and Qilin Yin and Jiarui Liu and Wei Lu and Xiangyang Luo and Jiantao Zhou},
journal= {arXiv preprint arXiv:2412.13656},
year = {2025}
}