中文

基于序列解耦的对比说话人嵌入

音频与语音处理 2023-09-26 v1 声音

摘要

对比说话人嵌入假设语音段正负对之间的对比仅归因于说话人身份。然而,该假设并不正确,因为语音信号不仅包含说话人身份,还包含语言内容。本文中,我们提出一种带序列解耦的对比学习框架,通过将解耦序列变分自编码器(DSVAE)融入常规 SimCLR 框架来去除语言内容。DSVAE 旨在于嵌入空间中将说话人因子与内容因子解耦,从而仅使用说话人因子构建对比损失目标。由于内容因子已从对比学习中移除,所得说话人嵌入将是内容不变的。在 VoxCeleb1-test 上的实验结果表明,所提方法持续优于 SimCLR。这表明应用序列解耦有益于学习具有说话人判别性的嵌入。

关键词

引用

@article{arxiv.2309.13253,
  title  = {Contrastive Speaker Embedding With Sequential Disentanglement},
  author = {Youzhi Tu and Man-Wai Mak and Jen-Tzung Chien},
  journal= {arXiv preprint arXiv:2309.13253},
  year   = {2023}
}

备注

Submitted to ICASSP 2024