基于渐进式音频语言共学习网络的弱监督音频时序伪造定位
声音
2025-05-08 v2 计算机视觉与模式识别
多媒体
音频与语音处理
摘要
音频时序伪造定位(ATFL)旨在寻找部分被有意修改的伪造音频的精确伪造区域。现有ATFL方法依赖于使用细粒度标注高效训练网络,而这些标注在现实场景下成本高昂且难以获取。为此,本文提出一种渐进式音频语言共学习网络(LOCO),采用共学习和自监督方式,在弱监督场景下推动定位性能。具体而言,首先设计了音频语言共学习模块,通过从时间和全局视角对齐语义来捕获伪造共识特征。在该模块中,使用话语级别标注结合可学习的提示构建伪造感知提示,可动态地将语义先验融入时间内容特征中。此外,还应用了伪造定位模块,基于融合后的伪造激活序列产生伪造提案。最后,引入渐进式细化策略生成伪帧级标签,并利用监督语义对比学习放大真实内容与伪造内容之间的语义差异,从而持续优化伪造感知特征。大量实验表明,所提出的LOCO在三个公开基准数据集上实现了SOTA性能。
引用
@article{arxiv.2505.01880,
title = {Weakly-supervised Audio Temporal Forgery Localization via Progressive Audio-language Co-learning Network},
author = {Junyan Wu and Wenbo Xu and Wei Lu and Xiangyang Luo and Rui Yang and Shize Guo},
journal= {arXiv preprint arXiv:2505.01880},
year = {2025}
}
备注
9pages, 5figures. This paper has been accepted for IJCAI2025