基于序列解耦的对比说话人嵌入
音频与语音处理
2023-09-26 v1 声音
摘要
对比说话人嵌入假设语音段正负对之间的对比仅归因于说话人身份。然而,该假设并不正确,因为语音信号不仅包含说话人身份,还包含语言内容。本文中,我们提出一种带序列解耦的对比学习框架,通过将解耦序列变分自编码器(DSVAE)融入常规 SimCLR 框架来去除语言内容。DSVAE 旨在于嵌入空间中将说话人因子与内容因子解耦,从而仅使用说话人因子构建对比损失目标。由于内容因子已从对比学习中移除,所得说话人嵌入将是内容不变的。在 VoxCeleb1-test 上的实验结果表明,所提方法持续优于 SimCLR。这表明应用序列解耦有益于学习具有说话人判别性的嵌入。
引用
@article{arxiv.2309.13253,
title = {Contrastive Speaker Embedding With Sequential Disentanglement},
author = {Youzhi Tu and Man-Wai Mak and Jen-Tzung Chien},
journal= {arXiv preprint arXiv:2309.13253},
year = {2023}
}
备注
Submitted to ICASSP 2024