中文

基于相位和幅值的共注意力机制特征融合用于说话人识别

音频与语音处理 2025-10-20 v1

摘要

与声源特征相关的相位特征可被纳入基于幅值的说话人识别系统,以提高系统性能。然而,传统的特征级融合方法通常忽略了说话人语义在幅值和相位域中的独特贡献。为此,本文提出了一种基于共注意力机制的特征级融合框架用于说话人识别。该框架分别包含用于幅值和相位域的两个子网络。随后,通过共注意力机制在池化层之前融合两个域的中间高级输出。来自共注意力模块的相关矩阵据称根据不同发音动态重新分配幅值和相位域中贡献的权重。在 VoxCeleb 数据集上的实验表明,使用共注意力机制实现的特征级融合策略在 Top-1准确率上达到 97.20%,显著优于最新的系统(提升 0.82%),并以 0.45% 的 EER 降低优于仅使用 FBank 的单一特征系统。

关键词

引用

@article{arxiv.2510.15659,
  title  = {Magnitude and Phase-based Feature Fusion Using Co-attention Mechanism for Speaker recognition},
  author = {Rongfeng Su and Mengjie Du and Xiaokang Liu and Lan Wang and Nan Yan},
  journal= {arXiv preprint arXiv:2510.15659},
  year   = {2025}
}