中文

用于防伪说话人验证的表示选择性自蒸馏与 wav2vec 2.0 特征探索

音频与语音处理 2022-11-08 v2

摘要

文本转语音和语音转换研究不断改进,已能生成几乎与真实人类语音无法区分的合成语音。就此而言,自动说话人验证(ASV)系统抵御合成语音攻击的反制措施(CM)的重要性凸显。然而,大多数端到端欺骗检测网络是黑盒系统,何种有效表示可用于发现伪影仍不明了。本文利用 wav2vec 2.0 考察何种特征空间能有效表示合成伪影,并研究何种架构能有效利用该空间。我们的研究得以分析语音信号的何种属性有益于 CM 系统。所提 CM 系统在 ASVspoof 2019 LA 评估集的欺骗检测任务上取得了 0.31% 的等错误率(EER)。我们进一步提出一种简单而有效的防伪说话人验证(SASV)方法,其利用了来自反制系统的解耦表示。使用 SASV Challenge 2022 数据库进行的评估显示 SASV EER 为 1.08%。定量分析表明,使用所探索的 wav2vec 2.0 特征空间对欺骗 CM 和 SASV 均有益处。

关键词

引用

@article{arxiv.2204.02639,
  title  = {Representation Selective Self-distillation and wav2vec 2.0 Feature Exploration for Spoof-aware Speaker Verification},
  author = {Jin Woo Lee and Eungbeom Kim and Junghyun Koo and Kyogu Lee},
  journal= {arXiv preprint arXiv:2204.02639},
  year   = {2022}
}

备注

Accepted to be published in the Proceedings of Interspeech 2022