基于残差注意力网络的气声模态自动分类
音频与语音处理
2021-07-20 v1 声音
摘要
发声模态是演唱风格的基本特征,也是表演的重要表达形式。它可分为四类:中性、气声、紧声与流声。以往研究使用嗓音质量特征与特征工程进行分类。尽管深度学习在音乐信息检索(MIR)的其他领域已取得显著进展,但在发声模态分类方面的尝试甚少。本研究提出一种基于残差注意力(Residual Attention)的网络用于发声模态的自动分类。该网络由一个执行特征处理的卷积网络和一个使网络聚焦于特定区域的软掩码分支组成。在对比实验中,采用所提网络的模型在四个数据集中的三个上取得了优于以往工作的结果,其中最高分类准确率为 94.58%,比基线高 2.29%。
引用
@article{arxiv.2107.08425,
title = {Residual Attention Based Network for Automatic Classification of Phonation Modes},
author = {Xiaoheng Sun and Yiliang Jiang and Wei Li},
journal= {arXiv preprint arXiv:2107.08425},
year = {2021}
}