中文

Nes2Net:面向基础模型驱动的语音反欺骗的轻量级嵌套架构

音频与语音处理 2025-10-28 v2 人工智能 声音

摘要

语音基础模型通过提供卓越的表示能力,显著推进了各种语音相关任务。然而,它们的高维输出特征常常与下游任务模型产生不匹配,后者通常需要较低维度的输入。一种常见的解决方案是应用降维(DR)层,但这种方法增加了参数开销、计算成本,并存在丢失有价值信息的风险。为了解决这些问题,我们提出了Nested Res2Net(Nes2Net),一种轻量级后端架构,旨在无需DR层直接处理高维特征。嵌套结构增强了多尺度特征提取,改善了特征交互,并保留了高维信息。我们首先在歌唱声音深度伪造检测数据集CtrSVDD上验证了Nes2Net,报告了相对于最先进基线22%的性能提升和87%的后端计算成本降低。此外,在四个不同数据集(ASVspoof 2021、ASVspoof 5、PartialSpoof和In-the-Wild)上的广泛测试,涵盖了完全伪造语音、对抗攻击、部分伪造和真实场景,一致地突出了Nes2Net卓越的鲁棒性和泛化能力。代码包和预训练模型可在https://github.com/Liu-Tianchi/Nes2Net获取。

关键词

引用

@article{arxiv.2504.05657,
  title  = {Nes2Net: A Lightweight Nested Architecture for Foundation Model Driven Speech Anti-spoofing},
  author = {Tianchi Liu and Duc-Tuan Truong and Rohan Kumar Das and Kong Aik Lee and Haizhou Li},
  journal= {arXiv preprint arXiv:2504.05657},
  year   = {2025}
}

备注

Accepted to IEEE Transactions on Information Forensics and Security