中文

面向反欺骗检测的自注意力融合预训练语音模型隐藏嵌入

计算与语言 2024-06-18 v1 声音 音频与语音处理

摘要

自监督学习(SSL)语音表示模型在大规模语音语料库上训练后, demonstrated 在通过多个变换层提取层次化语音嵌入方面具有有效性。然而,这些嵌入在特定任务中的行为尚不明确。本文调查了 WavLM 模型在反欺骗检测中的多层行为,并提出一种注意力融合方法以利用层次化隐藏嵌入。结果表明,通过微调 WavLM 可实现在 ASVspoof 2019LA、2021LA 和 2021DF 评估数据集上的最佳等效错误率(EER)分别为 0.65%、3.50% 和 3.19%。值得注意的是,我们发现 WavLM 大型模型的早期隐藏变换层对反欺骗任务贡献显著,通过使用部分预训练模型实现计算效率。

关键词

引用

@article{arxiv.2406.10283,
  title  = {Attentive Merging of Hidden Embeddings from Pre-trained Speech Model for Anti-spoofing Detection},
  author = {Zihan Pan and Tianchi Liu and Hardik B. Sailor and Qiongqiong Wang},
  journal= {arXiv preprint arXiv:2406.10283},
  year   = {2024}
}