用于深度伪造定位的不一致性感知多模态Schrödinger Bridge
计算机视觉与模式识别
2026-05-25 v1
摘要
音视频深度伪造定位需要区间级输出作为时间证据。尽管近期取得了进展,但在单侧或异步伪造下的对称融合会传播跨模态噪声,降低高精度定位性能。我们提出了IaMSB,一种不一致性感知的多模态Schrödinger Bridge (SB),可联合估计跨模态一致性并执行区间级定位。与扩散模型不同,SB最小化路径分布差异并在不显式注入噪声或去噪的情况下产生一致性分数。借助Schrödinger Bridge (SB),IaMSB在一个框架中统一了一致性估计、跨模态信息选择和桥步调度。具体而言,一个轻量级粗桥首先提出候选区间并估计跨模态一致性;这些统计量选择跨模态见证信号并在各模态间非对称地分配桥步。随后,一个精化桥执行步调融合并输出精化的、时间对齐的区间。IaMSB预判单侧和异步伪造,并利用带瓶颈的跨模态交互与步长分配,抑制噪声传递,避免不必要的迭代。在各项基准测试中,IaMSB稳定了严格IoU边界精度,将[email protected]提升了3%~10%,并产生了改善的高精度定位,特别是对于单侧伪造。
引用
@article{arxiv.2605.23113,
title = {Inconsistency-aware Multimodal Schr\"odinger Bridge for Deepfake Localization},
author = {Jiayu Xiong and Jing Wang and Qi Zhang and Wanlong Wang and Jun Xue},
journal= {arXiv preprint arXiv:2605.23113},
year = {2026}
}
备注
Accepted by CVPR2026