中文

Self-FiLM:利用自监督表征条件化 GAN 以进行带宽扩展的说话人识别

音频与语音处理 2023-03-08 v1

摘要

语音超分辨率/带宽扩展(BWE)可改善自动说话人验证(ASV)等下游任务。我们提出一种简单新颖的技术 Self-FiLM,通过特征线性调制(Feature-wise Linear Modulation)将自监督注入现有 BWE 模型。我们假设此类信息捕获了领域/环境信息,从而可实现零样本泛化。Self-FiLM 条件 GAN(CGAN)在 SRE21 测试集上采用最先进 ASV 系统时,等错误率相对降低 18%,最小检测代价函数降低 8.5%。我们进一步通过 1)时域模型的深度特征损失以及 2)在自然人宽带数据(VoxCeleb)和电话数据(SRE Superset 等)上重新训练 data2vec 2.0 模型来改进。最后,我们将自监督与 CycleGAN 结合,提出一种完全无监督的方案,其性能与半监督方案相当。

关键词

引用

@article{arxiv.2303.03657,
  title  = {Self-FiLM: Conditioning GANs with self-supervised representations for bandwidth extension based speaker recognition},
  author = {Saurabh Kataria and Jesús Villalba and Laureano Moro-Velázquez and Thomas Thebaud and Najim Dehak},
  journal= {arXiv preprint arXiv:2303.03657},
  year   = {2023}
}

备注

Under review