中文

基于多任务学习的弱监督多模态时序伪造定位

计算机视觉与模式识别 2025-08-05 v1

摘要

深度伪造视频的传播引发了信任危机并损害了社会稳定。尽管已有众多方法被提出以应对深度伪造检测和定位的挑战,但对于弱监督多模态细粒度时序伪造定位仍缺乏系统性研究。在本文中,我们提出了一种新颖的基于多任务学习的弱监督多模态时序伪造定位方法,该方法在多任务学习范式下解决了弱监督多模态细粒度时序伪造定位问题。WMMT仅使用视频级别的标注,即可实现多模态细粒度深度伪造检测和时序部分伪造定位。具体而言,视觉和音频模态检测被表述为两个二分类任务。引入多任务学习范式以将这些任务整合为一个多模态任务。此外,WMMT利用混合专家结构来自适应地选择合适的特征和定位头,在弱监督多模态细粒度时序伪造定位中实现了出色的灵活性和定位精度。提出了一种具有时序属性保持注意力机制的特征增强模块,以识别模态内和模态间的特征偏差并构建全面的视频特征。为了进一步探索弱监督学习的时序信息,提出了一种可扩展的偏差感知损失,旨在扩大伪造样本相邻片段的偏差并减少真实样本的偏差。大量实验证明了多任务学习在弱监督多模态细粒度时序伪造定位中的有效性,并且WMMT在多个评估指标上取得了与全监督方法相当的结果。

关键词

引用

@article{arxiv.2508.02179,
  title  = {Weakly Supervised Multimodal Temporal Forgery Localization via Multitask Learning},
  author = {Wenbo Xu and Wei Lu and Xiangyang Luo},
  journal= {arXiv preprint arXiv:2508.02179},
  year   = {2025}
}

备注

13 pages,4 figures. arXiv admin note: text overlap with arXiv:2507.16596