EnvSSLAM-FFN:针对ESDD 2026挑战赛的轻量级层融合系统
声音
2025-12-24 v1 音频与语音处理
摘要
近期生成式音频模型的进展使环境声合成具有高保真度,这对音频安全构成严重威胁。因此,ESDD 2026挑战赛在未见生成器下(Track 1)和黑盒低资源检测(Track 2)条件下针对环境声深度伪造检测。我们提出EnvSSLAM-FFN,将冻结的SSLAM自监督编码器与轻量级FFN后端集成。为有效捕捉严重数据不平衡下的欺骗性痕迹,我们融合来自层4-9的中间SSLAM表示,并采用类别加权训练目标。实验结果表明,所提出的系统在两个轨道上均 consistently 优于官方基线,分别实现了测试等错误率( EER)为1.20%和1.05%。
引用
@article{arxiv.2512.20369,
title = {EnvSSLAM-FFN: Lightweight Layer-Fused System for ESDD 2026 Challenge},
author = {Xiaoxuan Guo and Hengyan Huang and Jiayi Zhou and Renhe Sun and Jian Liu and Haonan Cheng and Long Ye and Qin Zhang},
journal= {arXiv preprint arXiv:2512.20369},
year = {2025}
}
备注
ESDD 2026 Challenge Technical Report