基于上下文感知的多头因子化注意力池化用于 SSL 语音验证
音频与语音处理
2024-09-24 v1 声音
摘要
基于自监督学习(SSL)的语音验证(SV)模型近年来受到广泛关注。然而,现有的 SSL 基于 SV 系统往往难以捕获局部时间依赖性,并在不同任务之间泛化。本文提出了一种轻量级框架——上下文感知多头因子化注意力池化(CA-MHFA),其融合来自周围帧的上下文信息。CA-MHFA 利用分组、可学习的查询来有效建模上下文依赖,同时通过在各组之间共享键和值来保持效率。在 VoxCeleb 数据集上的实验结果表明,CA-MHFA 在 Vox1-O、Vox1-E 和 Vox1-H 上的分别实现了 0.42\%、0.48\% 和 0.96\% 的 EER,超越了参数更少且收敛更快的 WavLM-TDNN 等复杂模型。此外,CA-MHFA 在多个 SSL 模型和任务(包括情感识别和反欺骗)上表现出强大的泛化能力,凸显了其鲁棒性和多功能性。
引用
@article{arxiv.2409.15234,
title = {CA-MHFA: A Context-Aware Multi-Head Factorized Attentive Pooling for SSL-Based Speaker Verification},
author = {Junyi Peng and Ladislav Mošner and Lin Zhang and Oldřich Plchot and Themos Stafylakis and Lukáš Burget and Jan Černocký},
journal= {arXiv preprint arXiv:2409.15234},
year = {2024}
}
备注
Submitted to ICASSP 2025