面向 ESDD 2026 挑战的环境声音深度伪造检测的 BUT 系统
音频与语音处理
2025-12-10 v1
摘要
本文描述了 BUT 团队提交至 ESDD 2026 挑战的方案,具体聚焦于轨道 1:环境声音深度伪造检测与未见生成器。为解决该挑战中对未见声音合成算法泛化能力的关键问题,我们提出了一种利用多样化自监督学习 (SSL) 模型构建的鲁棒性集成框架。我们对通用音频 SSL 模型(包括 BEATs、EAT 和 Dasheng)以及语音专用 SSL 进行了全面分析。这些前端模块与轻量级多头分解注意力 (MHFA) 后端相结合,以捕获判别性表征。进一步,我们引入了基于分布不确定性建模的特征域数据增强策略,以增强模型对未见谱系失真的鲁棒性。所有模型均仅使用官方 EnvSDD 数据进行训练,不使用任何外部资源。实验结果表明,我们的方法有效性:最佳单系统在开发集、进度集 (轨道 1) 和最终评估集上分别实现了 0.00%、4.60% 和 4.80% 的等错误率 (EER)。融合系统进一步提升了泛化能力,在相同数据划分上实现了 0.00%、3.52% 和 4.38% 的 EER。
关键词
引用
@article{arxiv.2512.08319,
title = {BUT Systems for Environmental Sound Deepfake Detection in the ESDD 2026 Challenge},
author = {Junyi Peng and Lin Zhang and Jin Li and Oldrich Plchot and Jan Cernocky},
journal= {arXiv preprint arXiv:2512.08319},
year = {2025}
}