中文

RawTFNet:用于语音防欺骗的轻量级 CNN 架构

音频与语音处理 2025-07-14 v1 声音

摘要

自动说话人验证 (ASV) 系统常受到欺骗攻击的影响。最近的基于 transformer 的模型通过学习强特征表示提高了防欺骗性能,但这些模型通常需要高计算资源。为此,我们引入 RawTFNet,一个专为音频信号设计的轻量级 CNN 模型。RawTFNet 沿时间和频率维度分离特征处理,这有助于捕捉人造语音的细粒度细节。我们在 ASVspoof 2021 LA 和 DF 评估数据集上测试了 RawTFNet。结果表明,RawTFNet 达到了与最先进模型相当的性能,同时也使用了更少的计算资源。代码和模型将公开提供。

关键词

引用

@article{arxiv.2507.08227,
  title  = {RawTFNet: A Lightweight CNN Architecture for Speech Anti-spoofing},
  author = {Yang Xiao and Ting Dang and Rohan Kumar Das},
  journal= {arXiv preprint arXiv:2507.08227},
  year   = {2025}
}

备注

Submitted to APSIPA ASC 2025