中文

DFKI-Speech 系统用于野生语音挑战:面向 SASV 野生环境的稳健框架

声音 2026-02-03 v1 人工智能 机器学习

摘要

本文介绍了为野生语音挑战(WildSpoof Challenge)开发的 DFKI-Speech 系统,专注于欺骗感知自动说话人验证(SASV)轨道。我们提出了一种稳健的 SASV 框架,其中欺骗检测器与说话人验证(SV)网络协同工作。欺骗检测器采用自监督语音嵌入提取器作为前端,结合最先进的图神经网络后端。此外,采用基于 Top-3 层的混合专家(MoE)方法融合高级和低级特征,以有效检测伪造语音。对于说话人验证,我们采用适配低复杂度卷积神经网络, fuse 2D 和 1D 特征在多个尺度上进行特征融合,并使用 SphereFace loss 进行训练。此外,应用对比圆损失以适当加权每个训练 batch 中的正负样本对,使网络能够更好地区分难样本和易样本对。最后,使用基于固定冒名户队列的 AS Norm 得分归一化和模型集成进一步提升说话人验证系统的判别能力。

关键词

引用

@article{arxiv.2602.02286,
  title  = {DFKI-Speech System for WildSpoof Challenge: A robust framework for SASV In-the-Wild},
  author = {Arnab Das and Yassine El Kheir and Enes Erdem Erdogan and Feidi Kallel and Tim Polzehl and Sebastian Moeller},
  journal= {arXiv preprint arXiv:2602.02286},
  year   = {2026}
}