Aletheia:基于物理条件的局部性工件注意力(PhyLAA-X)用于端到端通用且稳健的深度伪造视频检测
摘要
最先进的深度伪造检测器在内域情境下几乎实现完美准确率,但在跨生成器偏移、重压缩和对抗性扰动下会显著下降。其核心局限性仍在于语义工件学习与物理不变性的脱钩:光流不连续性、镜面反射不一致性和心搏调制反射率(rPPG)要么作为后处理特征要么被忽略。我们引入PhyLAA-X,这是一种基于物理条件的Localized Artifact Attention(LAA-X)扩展。PhyLAA-X将三种端到端可微的物理派生特征体积——光流旋度、镜面反射偏度和空间上升采样后的rPPG功率谱——直接注入LAA-X注意力计算,通过交叉注意力门控和共振一致性损失实现。这迫使网络在语义不一致与物理违规共同发生的区域学习操纵边界——这些区域本质上对生成模型而言在一致性上更难以复制。PhyLAA-X嵌入在一种高效时空集成中(EfficientNet-B4+BiLSTM、ResNeXt-101+Transformer、Xception+因果Conv1D),并采用不确定性感知的自适应加权。实验表明,在FaceForensics++(c23)上,Aletheia达到97.2%准确率/0.992 AUC-ROC;在Celeb-DF v2上为94.9%/0.981;在DFDC上为90.8%/0.966——在跨生成器设置下优于最强公开基线(LAA-Net[1])提升4.1-7.3个百分点,并在epsilon=0.02 PGD-10攻击下保持79.4%准确率。单骨架消融实验确认PhyLAA-X本身即可带来4.2%的跨数据集AUC提升。完整的生产系统已于2026年4月发布v1.2,包含预训练权重、对抗语料库(本工作中称为ADC-2026)以及完整的可重复性制品。
引用
@article{arxiv.2604.16486,
title = {Aletheia: Physics-Conditioned Localized Artifact Attention (PhyLAA-X) for End-to-End Generalizable and Robust Deepfake Video Detection},
author = {Devendra Ghori},
journal= {arXiv preprint arXiv:2604.16486},
year = {2026}
}
备注
Code: https://github.com/devghori1264/Aletheia (MIT license). Dataset notes: see Data and Code Availability section