中文

OmniFD:面向多场景人脸 Forgery 检测的统一模型

计算机视觉与模式识别 2025-12-02 v1

摘要

人脸 forgery 检测涵盖多个关键任务,包括识别伪造图像和视频、定位人造区域和时序片段。当前方法通常采用任务特定模型,独立架构,导致计算冗余并忽视跨相关任务的潜在关联。我们引入OmniFD,一个统一框架,同时解决四个核心人脸 forgery 检测任务,即图像和视频分类、空间定位和时序定位。我们的架构包含三个主要组件:(1)一个共享的Swin Transformer 编码器,从图像和视频输入中提取统一的4D时空表示;(2)一个带有可学习查询的跨任务交互模块,通过注意力机制动态捕获任务间依赖关系;(3)轻量级解码头将精炼后的表示转化为所有FFD任务的相应预测。大量实验表明,OmniFD优于任务特定模型。其统一设计利用多任务学习捕获跨任务的通用表示,尤其实现细粒度知识传递,促进其他任务。例如,纳入图像数据后,视频分类准确率提升4.63%。此外,通过统一图像、视频和四个任务于一个框架中,OmniFD在多样化基准测试中实现卓越性能,同时具有高效可扩展性,例如减少63%的模型参数和50%的训练时间。它为实际应用中的综合人脸 forgery 检测树立了实用且可泛化的解决方案。源代码已公开于 https://github.com/haotianll/OmniFD。

关键词

引用

@article{arxiv.2512.01128,
  title  = {OmniFD: A Unified Model for Versatile Face Forgery Detection},
  author = {Haotian Liu and Haoyu Chen and Chenhui Pan and You Hu and Guoying Zhao and Xiaobai Li},
  journal= {arXiv preprint arXiv:2512.01128},
  year   = {2025}
}