中文

分而治之:通过跨模态融合与定位进行多模态视频深度伪造检测

多媒体 2026-02-03 v1

摘要

本文提出了用于 DDL 挑战 Track 2 的视频深度伪造检测系统。该系统采用两阶段框架,包括单模态检测和多模态得分融合。具体而言,它集成了音频深度伪造检测模块和音频定位模块,用于分析并标记音频流中被操纵的片段。并行地,采用基于图像的深度伪造检测和定位模块处理视觉模态。为有效利用不同模态中互补信息,我们进一步提出了多模态得分融合策略,将来自音频和视觉模块的输出整合在一起。根据对训练和评估数据集的详细分析,我们探讨和评估了若干得分计算和融合策略,以提高系统的鲁棒性。总体而言,最终的融合系统在挑战测试集上实现了 AUC 为 0.87、AP 为 0.55、AR 为 0.23 的综合得分 0.5528。

关键词

引用

@article{arxiv.2602.00209,
  title  = {Divide and Conquer: Multimodal Video Deepfake Detection via Cross-Modal Fusion and Localization},
  author = {Qingcao Li and Miao He and Liang Yi and Qing Wen and Yitao Zhang and Hongshuo Jin and Peng Cheng and Zhongjie Ba and Li Lu and Kui Ren},
  journal= {arXiv preprint arXiv:2602.00209},
  year   = {2026}
}

备注

The 3rd Place, IJCAI 2025 Workshop on Deepfake Detection, Localization, and Interpretability