受控演唱声深度伪造检测(CtrSVDD)挑战 2024 的语音基础模型集成
音频与语音处理
2024-10-22 v1 人工智能
声音
摘要
本工作详细阐述了我们在受控演唱声深度伪造检测(CtrSVDD)评估数据集上实现 1.79% 汇合等价错误率(EER)的系统方法。生成式 AI 模型的快速发展为检测 AI 生成的深度伪造演唱声带来了重大挑战,吸引了更多研究注意。受控演唱声深度伪造检测挑战 2024 旨在解决这一复杂任务。在本工作中,我们探索了集成方法,利用语音基础模型开发稳健的演唱声反欺诈系统。我们还引入了一种新颖的 Squeeze-and-Excitation Aggregation(SEA) 方法,该方法有效且高效地整合了来自语音基础模型的表示特征,超越了我们其他各个单一系统的性能。评估结果确认了我们方法在检测深度伪造演唱声方面的有效性。代码可在 https://github.com/Anmol2059/SVDD2024 访问。
引用
@article{arxiv.2409.02302,
title = {Speech Foundation Model Ensembles for the Controlled Singing Voice Deepfake Detection (CtrSVDD) Challenge 2024},
author = {Anmol Guragain and Tianchi Liu and Zihan Pan and Hardik B. Sailor and Qiongqiong Wang},
journal= {arXiv preprint arXiv:2409.02302},
year = {2024}
}
备注
Accepted to the IEEE Spoken Language Technology Workshop (SLT) 2024