中文

LG Uplus系统:面向WildSpoof挑战的多说话人ID与基于判别器的子裁判

音频与语音处理 2025-12-11 v1

摘要

本文描述了我们在WildSpoof挑战赛Track 2中的提交,该赛道聚焦于存在高质量文本转语音(TTS)攻击下的欺骗感知说话人验证(SASV)。我们采用ResNet-221骨干网络,研究了两种说话人标签策略,即双说话人ID(Dual-Speaker IDs)和多说话人ID(Multi-Speaker IDs),以在嵌入空间中显式扩大真实语音与生成语音之间的间隔。此外,我们提出了基于判别器的子裁判系统,复用HiFi-GAN和BigVGAN判别器的内部特征,通过多查询多头注意力统计池化(MQMHA)进行聚合。在SpoofCeleb语料库上的实验结果表明,我们的系统设计在提升无关检测代价函数(a-DCF)方面是有效的。

关键词

引用

@article{arxiv.2512.09000,
  title  = {LG Uplus System with Multi-Speaker IDs and Discriminator-based Sub-Judges for the WildSpoof Challenge},
  author = {Jinyoung Park and Won Jang and Jiwoong Park},
  journal= {arXiv preprint arXiv:2512.09000},
  year   = {2025}
}

备注

3 pages, 2 figures, 2 tables