基于层融合的 BEAT2AASIST 模型用于 ESDD 2026 挑战
声音
2025-12-18 v1 机器学习
摘要
近期音频生成技术的进展增加了对真实环境声音被操纵的风险,从而激发了 ESDD 2026 挑战的设立,作为首个大规模环境声深度伪造检测基准。我们提出 BEAT2AASIST,该模型通过沿频率或通道维度分割 BEATs 派生的表示,并使用双 AASIST 分支进行处理。为丰富特征表示,我们采用拼接、CNN 门控和 SE 门控策略集成 top-k 变换层融合。此外,还应用了基于声码器的数据增强,以提高对未见操纵方法的鲁棒性。实验结果表明,在官方测试集上,所提出的方法在挑战各轨道上均实现了竞争性能。
引用
@article{arxiv.2512.15180,
title = {BEAT2AASIST model with layer fusion for ESDD 2026 Challenge},
author = {Sanghyeok Chung and Eujin Kim and Donggun Kim and Gaeun Heo and Jeongbin You and Nahyun Lee and Sunmook Choi and Soyul Han and Seungsang Oh and Il-Youp Kwak},
journal= {arXiv preprint arXiv:2512.15180},
year = {2025}
}
备注
3 pages, 1 figure, challenge paper