基于注意力池化的说话人特征化
音频与语音处理
2024-05-08 v1 声音
摘要
面向说话人验证的深度学习系统通常基于说话人嵌入提取器。这些架构通常由特征提取前端和用于将可变长度语音编码为固定长度说话人向量的池化层组成。最近的研究提出使用双多头自注意力池化用于说话人识别,置于基于 CNN 的前端和一组全连接层之间。这一方法表现出色,能够有效选择语音信号中由前端捕获的最相关特征。在本文中,我们通过将其架构适用于其他不同说话人特征化任务(如情感识别、性别分类和新冠肺炎检测),实现了优异的实验结果。
引用
@article{arxiv.2405.04096,
title = {Speaker Characterization by means of Attention Pooling},
author = {Federico Costa and Miquel India and Javier Hernando},
journal= {arXiv preprint arXiv:2405.04096},
year = {2024}
}
备注
IberSpeech 2022