面向深度说话人识别的细粒度早期频率注意力
声音
2022-07-21 v1 音频与语音处理
摘要
注意力机制已成为提升深度模型性能的重要工具,使其能聚焦于所学嵌入的关键部分。然而,当前用于说话人识别任务的注意力机制未能考虑细粒度信息项,例如深度网络所用输入谱表示中的频率 bin。为解决此问题,我们提出新颖的细粒度早期频率注意力(FEFA)用于真实场景下的说话人识别。一旦集成到深度神经网络中,我们所提机制通过从网络早期层获取查询并生成可学习权重,以关注小至输入谱表示中频率 bin 的信息项。为评估 FEFA 的性能,我们使用若干知名深度模型作为骨干网络,并将我们的注意力模块集成到其流水线中。这些网络(含与不含 FEFA)的总体性能在 VoxCeleb1 数据集上评估,我们观察到使用 FEFA 时有显著提升。
引用
@article{arxiv.2207.10006,
title = {Fine-grained Early Frequency Attention for Deep Speaker Recognition},
author = {Amirhossein Hajavi and Ali Etemad},
journal= {arXiv preprint arXiv:2207.10006},
year = {2022}
}
备注
Accepted In IJCNN 2022