AuViRe:面向深度伪造时序局部的音视频语音表征重建
计算机视觉与模式识别
2025-11-25 v1
摘要
随着精细化合成音视频内容(如用于隐蔽恶意操纵)的快速发展,确保数字媒体完整性已成为当务之急。本文提出一种新颖方法,通过利用音视频语音表征重建(Audio-Visual Speech Representation Reconstruction, AuViRe)实现深度伪造的时序局部。具体而言,我们的方法基于一种模态(如唇部动作)重建另一种模态(如音频波形)的语音表征。由于在被操纵的视频片段中进行跨模态重建要更具挑战性,因此会放大差异,从而为精确的时序伪造局部分提供稳健的判别线索。AuViRe 在 LAV-DF 上将 [email protected] 提升 +8.9,在 AV-Deepfake1M 上将 [email protected] 提升 +9.6,在野外实验中将 AUC 提升 +5.1。代码已公开于 https://github.com/mever-team/auvire。
引用
@article{arxiv.2511.18993,
title = {AuViRe: Audio-visual Speech Representation Reconstruction for Deepfake Temporal Localization},
author = {Christos Koutlis and Symeon Papadopoulos},
journal= {arXiv preprint arXiv:2511.18993},
year = {2025}
}
备注
WACV 2026