基于同构图注意力网络池化的自监督表征说话人识别
声音
2024-02-27 v2 音频与语音处理
摘要
自监督表征(即 wav2vec 2.0)的出现使得说话人识别方法能够通过构建在语音数据上的基础模型来处理语音信号。然而,由于采用了固定或次优的时间池化策略,对该表征的有效融合仍需进一步研究。尽管已有改进策略考虑了图学习与图注意力因素,这些方法中仍存在非单射聚合,可能影响说话人识别的性能。为此,我们提出一种在自监督表征上使用同构图注意力网络(Isomorphic Graph ATtention network, IsoGAT)的说话人识别方法。所提方法包含表征学习、图注意力与聚合三个模块,联合考虑自监督表征与 IsoGAT 上的学习。随后,我们在 VoxCeleb1&2 数据集上进行了说话人识别任务的实验,相应实验结果证明了所提方法相较于自监督表征上现有池化方法的识别性能。
引用
@article{arxiv.2308.04666,
title = {Speaker Recognition Using Isomorphic Graph Attention Network Based Pooling on Self-Supervised Representation},
author = {Zirui Ge and Xinzhou Xu and Haiyan Guo and Tingting Wang and Zhen Yang},
journal= {arXiv preprint arXiv:2308.04666},
year = {2024}
}
备注
9 pages, 4 figures