中文

EnvTriCascade:面向 ESDD2 2026 挑战赛的环境感知三阶段级联框架

声音 2026-05-19 v1

摘要

现实场景中的音频深度伪造检测(ADD)已从仅语音欺骗演变为更具挑战性的组件级设置,其中语音和环境声音可能被独立操纵。为了解决这一问题,我们提出了 EnvTriCascade,一个面向 ESDD2 挑战赛的环境感知三阶段级联框架。首先,混合一致性检测器提供二值先验以区分原始录音和被操纵的混合物,从而校准最终决策。接下来,两个互补的五分类检测器分别利用 SSLAM+XLS-R 和 EAT-large+XLS-R 表示,提取鲁棒的多分支特征,并通过跨分支注意力门控分类器进行整合。为了增强对各种混合条件的鲁棒性,我们引入了 RawBoost 数据增强。我们的系统完全在官方 CompSpoofV2 数据集上训练,在测试集上取得了 0.8266 的 Macro-F1 分数,显著优于官方基线并在挑战赛中排名第二。

关键词

引用

@article{arxiv.2605.18409,
  title  = {EnvTriCascade: An Environment-Aware Tri-Stage Cascaded Framework for ESDD2 2026 Challenge},
  author = {Hengyan Huang and Xiaoxuan Guo and Jiayi Zhou and Yuankun Xie and Jian Liu and Haonan Cheng and Long Ye and Qin Zhang},
  journal= {arXiv preprint arXiv:2605.18409},
  year   = {2026}
}