中文

基于 wav2vec2.0 框架的图特征融合说话人识别技术

音频与语音处理 2023-03-21 v1 声音

摘要

预训练的 wav2vec2.0 模型已被证明在说话人识别中具有有效性。然而,当前的特征处理方法主要集中在预训练 wav2vec2.0 模型输出特征的经典池化上,例如平均池化、最大池化等。这些方法将特征视为独立且不相关的单元,忽略了所有特征之间的相互关系,并且没有将特征作为说话人的整体表示。门控循环单元 (GRU) 作为一种特征融合方法,也可以被视为一种复杂的池化技术,主要关注时间信息,在主要信息不在时间维度上的某些情况下可能表现不佳。在本文中,我们研究将图神经网络 (GNN) 作为基于 wav2vec2.0 框架的后端处理模块,为上述问题提供解决方案。GNN 将所有输出特征作为图信号数据,并提取用于说话人识别的相关图结构信息。具体而言,我们首先给出了一个简单的证明,表明 GNN 特征融合方法在理论上可以优于平均池化、最大池化、随机池化等方法。然后,我们将 wav2vec2.0 的输出特征建模为图的顶点,并通过图注意力网络 (GAT) 构建图邻接矩阵。最后,我们遵循消息传递神经网络 (MPNN) 来设计我们的消息函数、顶点更新函数和读出函数,以将说话人特征转换为图特征。实验表明,与基线方法相比,我们的性能可以提供相对的改进。代码可在 xxx 获取。

关键词

引用

@article{arxiv.2303.10556,
  title  = {The Graph feature fusion technique for speaker recognition based on wav2vec2.0 framework},
  author = {Zirui Ge and Haiyan Guo and Zhen Yang},
  journal= {arXiv preprint arXiv:2303.10556},
  year   = {2023}
}