用于深度说话人表征学习的细粒度早期频率注意力
音频与语音处理
2023-01-25 v2 计算与语言
机器学习
声音
摘要
近年来,深度学习技术显著改善了语音处理。由深度学习模型提取的说话人表征正被广泛应用于说话人识别与语音情感识别等任务。注意力机制已在改善语音处理领域深度学习模型中开始发挥重要作用。然而,尽管重要的说话人相关信息可嵌入于输入谱表示的各个频率 bin 中,当前的注意力模型仍无法关注谱表示中的细粒度信息项。本文提出用于说话人表征学习的细粒度早期频率注意力(FEFA)。我们的模型简单轻量,可集成至多种CNN流水线中,并能够聚焦于小至频率 bin 的信息项。我们在说话人识别、语音情感识别和口语数字识别三项任务上评估所提模型。我们使用三个广泛使用的公开数据集,即VoxCeleb、IEMOCAP与Free Spoken Digit Dataset进行实验。我们将FEFA附加于若干著名深度学习模型并评估其对最终性能的影响。我们还将本工作与该领域其他相关工作比较。实验表明,将FEFA添加至不同CNN架构后性能持续大幅提升,且配备FEFA的模型优于所有其他注意力模型。我们还针对不同加噪水平测试了模型,显示出相比骨干网络在鲁棒性与灵敏度方面的改善。
引用
@article{arxiv.2009.01822,
title = {Fine-grained Early Frequency Attention for Deep Speaker Representation Learning},
author = {Amirhossein Hajavi and Ali Etemad},
journal= {arXiv preprint arXiv:2009.01822},
year = {2023}
}