PIA:基于音素时序与身份动态分析的深度伪造检测
计算机视觉与模式识别
2025-10-17 v1
摘要
操纵媒介的增多使得深度伪造成为一种尤为棘手的威胁,涉及 various 类型的生成式操纵,包括唇音同步修改、人脸换脸以及基于头像的面部合成。传统的检测方法主要依赖人工设计的音素-视嗨对齐阈值、基本帧级一致性检查或单模态检测策略,无法充分识别由生成式对抗网络、扩散模型和神经渲染技术等高级生成模型生成的现代深度伪造。这些高级技术虽然能够生成几乎完美的单个帧,却在不经意间制造出细微的时序差异,这些差异往往被传统检测器忽略。我们提出了一种新型多模态音视频框架——音素时序与身份动态分析(PIA),该框架融合语言信息、动态面部运动和面部身份识别线索,以解决上述局限性。我们利用音素序列、唇部几何数据以及先进的面部身份嵌入向量。这种集成方法通过在多个互补模态之间识别不一致性,显著提高了对细微深度伪造篡改的检测能力。代码已公开 https://github.com/skrantidatta/PIA
引用
@article{arxiv.2510.14241,
title = {PIA: Deepfake Detection Using Phoneme-Temporal and Identity-Dynamic Analysis},
author = {Soumyya Kanti Datta and Tanvi Ranga and Chengzhe Sun and Siwei Lyu},
journal= {arXiv preprint arXiv:2510.14241},
year = {2025}
}