3-Tracer:面向音频伪造检测与定位的三层时序感知框架
计算机视觉与模式识别
2025-12-02 v2
摘要
最近,部分音频伪造作为一种新的音频操纵形式涌现。攻击者有选择地修改部分但具有语义关键性的帧,同时保持整体感知上的真实性,使此类伪造在检测方面尤为困难。现有方法侧重于独立检测单个帧是否被伪造,缺乏捕捉不同时序层次上瞬时和持续性异常的层次结构。为此,我们识别了三个与部分音频伪造检测相关的关键层次,提出 T3-Tracer——首个联合在帧、段和音频三个层次分析音频的框架,以全面检测伪造痕迹。T3-Tracer 由两个互补的核心模块组成:帧-音频特征聚合模块 (FA-FAM) 和段级多尺度差异感知模块 (SMDAM)。FA-FAM 旨在检测每个音频帧的真实性。它结合了帧级和音频级时序信息,以检测帧内伪造线索和全局语义不一致性。为进一步细化和纠正帧检测结果,我们引入 SMDAM 在段级检测伪造边界。它采用双分支架构,联合建模帧特征和跨帧差异,覆盖多个时序窗口尺度,有效识别伪造边界处出现的突发性异常。在三个具有挑战性的数据集上进行的大量实验表明,我们的方法实现了最先进的性能。
引用
@article{arxiv.2511.21237,
title = {3-Tracer: A Tri-level Temporal-Aware Framework for Audio Forgery Detection and Localization},
author = {Shuhan Xia and Xuannan Liu and Xing Cui and Peipei Li},
journal= {arXiv preprint arXiv:2511.21237},
year = {2025}
}
备注
The experimental results in this paper have been further improved and updated; the baseline results do not match existing results, therefore the paper needs to be retracted