探查深度说话人嵌入用于说话人相关任务
音频与语音处理
2022-12-15 v1
摘要
深度说话人嵌入在说话人识别及其他说话人相关任务中已展现出有前景的结果。然而,一些问题仍待探索,例如这些表示中编码的信息及其对下游任务的影响。本文研究四种深度说话人嵌入,即 d-vector、x-vector、ResNetSE-34 与 ECAPA-TDNN。受人类发声机制启发,我们从身份、内容与信道角度探索可能编码的信息;基于此,在三类说话人相关任务上开展实验以进一步探究不同深度嵌入的影响,包括判别类任务(说话人验证与日记化)、引导类任务(目标说话人检测与提取)与调节类任务(多说话人文本到语音)。结果表明所有深度嵌入除说话人身份外均编码了信道与内容信息,但程度可能不同,且它们在说话人相关任务上的表现可有极大差异:ECAPA-TDNN 在判别类任务中占优,d-vector 引领引导类任务,而调节类任务对说话人表示的选择较不敏感。这些可能有益于未来利用说话人嵌入的研究。
引用
@article{arxiv.2212.07068,
title = {Probing Deep Speaker Embeddings for Speaker-related Tasks},
author = {Zifeng Zhao and Ding Pan and Junyi Peng and Rongzhi Gu},
journal= {arXiv preprint arXiv:2212.07068},
year = {2022}
}