中文

SoCov:面向说话人识别的半正交参数化协方差矩阵池化

音频与语音处理 2025-04-24 v1 声音

摘要

在传统的深度说话人嵌入框架中,池化层会对时间上对所有帧级特征进行聚合,并计算其均值和标准偏差统计量作为后续段级层的输入。这种统计池化策略会产生固定长度的表示,但将不同的帧级特征等同对待,丢弃了协方差信息。本文提出了一种半正交参数化协方差矩阵池化方法(SoCov)。SoCov 池化从自注意力帧级特征计算协方差矩阵,并通过半正交参数化向量压缩为向量,随后与加权标准差向量拼接作为段级层的输入。基于 SoCov 的深度嵌入称为“sc-vector”。在 SRE21 开发和评估数据集上,将 sc-vector 与多个基线方法进行比较。实验结果表明,sc-vector 系统在 SRE21Eval 上相对于传统 x-vector 系统实现了 15.5% 的 EER 相对降低。当使用自注意力深度特征时,SoCov 可将 SRE21Eval 上的 EER 降低约 30.9%。

关键词

引用

@article{arxiv.2504.16441,
  title  = {SoCov: Semi-Orthogonal Parametric Pooling of Covariance Matrix for Speaker Recognition},
  author = {Rongjin Li and Weibin Zhang and Dongpeng Chen and Jintao Kang and Xiaofen Xing},
  journal= {arXiv preprint arXiv:2504.16441},
  year   = {2025}
}

备注

This paper has been accepted by IEEE ICASSP2025