中文

说话人嵌入层编码了什么?

音频与语音处理 2025-12-23 v1

摘要

开发高质量的说话人嵌入层在语音社区受到广泛关注,i 向量和d 向量等表示方法在各种任务中展现出卓越的性能。尽管其应用广泛,但一个基本问题仍鲜有探讨:这些嵌入层实际编码了哪些属性?为此,我们对三种主要的说话人嵌入方法——i 向量、d 向量和基于RNN/LSTM的序列向量(s 向量)——进行了全面分析。通过设计严谨的分类任务,我们系统地探讨了它们在多个维度上的编码能力,包括说话人身份、性别、说话速率、文本内容、词序及信道信息。我们的分析揭示了每种嵌入类型的独特优势与局限:i 向量在说话人鉴别方面卓越,但编码有限的序列信息;s 向量能有效捕获文本内容和词序,但在说话人身份方面表现不足;d 向量表现平衡,却通过平均化丢失了序列信息。基于这些洞见,我们提出一种新型多任务学习框架,将i 向量与s 向量集成,产生一种新的说话人嵌入(i-s 向量),组合二者的互补优势。在RSR2015数据集上实验表明,与i 向量基线相比,i-s 向量在内容不匹配试验中实现了超过50%的等错误率(EER)降低,验证了我们方法的有效性。

关键词

引用

@article{arxiv.2512.18286,
  title  = {What Does the Speaker Embedding Encode?},
  author = {Shuai Wang and Yanmin Qian and Kai Yu},
  journal= {arXiv preprint arXiv:2512.18286},
  year   = {2025}
}

备注

This paper was accepted by Interspeech 2017. However, no public version is currently available, as the original link provided by ISCA is no longer accessible. The version uploaded herein has undergone automatic English polishing using GPT (Expanded for better calarity)