面向说话人识别的 Xi-Vector 嵌入
音频与语音处理
2021-08-13 v1 声音
摘要
我们提出了一种深度说话人嵌入的贝叶斯表述,其中 xi-vector 是 x-vector 的贝叶斯对应物,考虑了不确定性估计。在技术层面,我们为当前广泛使用的 x-vector 提供了一种简单直接的扩展。它由一个辅助神经网络预测输入序列的逐帧不确定性构成。我们表明,所提出的扩展在所有工作点上均带来实质性改进,显著降低了错误率与检测代价。在理论层面,我们的方案通过池化层将线性高斯模型的贝叶斯表述整合到说话人嵌入神经网络中。从某种意义上说,我们的方案将 i-vector 的贝叶斯表述与 x-vector 的贝叶斯表述相整合。因此,我们将该嵌入称为 xi-vector,其发音为 /zai/ vector。在 SITW 评测集上的实验结果表明,等错误率持续降低超过 17.5%,最小检测代价降低 10.9%。
引用
@article{arxiv.2108.05679,
title = {Xi-Vector Embedding for Speaker Recognition},
author = {Kong Aik Lee and Qiongqiong Wang and Takafumi Koshinaka},
journal= {arXiv preprint arXiv:2108.05679},
year = {2021}
}