深度说话人嵌入架构中的残余信息
音频与语音处理
2023-02-07 v1 人工智能
声音
摘要
说话人嵌入提供了一种从语音信号中提取具有代表性的向量表征的方法,使得该表征仅与说话人身份相关。这些嵌入通常用于对不同说话人进行分类和区分。然而,目前没有客观的度量来评估说话人嵌入将说话人身份与其他语音特征分离的能力。这意味着这些嵌入远非理想,高度依赖于训练语料库,并且仍然包含一定程度的残余信息,这些信息涉及话语的语言内容、录音条件或说话风格等因素。本文对由一些最新且高性能的 DNN 架构提取的六组说话人嵌入进行了分析,特别是分析了它们将说话人身份从语音信号中真正分离出来的程度。为了正确评估这些架构,使用了一个大型多说话人平行语音数据集。该数据集包含 46 名说话人朗读相同的提示语集,并在专业录音室或其家庭环境中录制。该分析考察了在不同嵌入集上计算的说话人内部和说话人之间的相似性度量,以及简单的分类和回归方法是否能够从说话人嵌入中提取多个残余信息因子。结果表明,所分析的嵌入的区分能力非常高,然而在所有分析的架构中,表征中仍然存在残余信息,表现为与录音条件、语言内容和话语持续时间的高度相关性。
引用
@article{arxiv.2302.02742,
title = {Residual Information in Deep Speaker Embedding Architectures},
author = {Adriana Stan},
journal= {arXiv preprint arXiv:2302.02742},
year = {2023}
}