PrimaDNN:面向演唱技巧检测的特征感知DNN定制
声音
2023-06-27 v1 机器学习
音频与语音处理
摘要
专业歌手调节其音色或音高以使演唱表现更具表现力。此类波动称为演唱技巧。从音轨中自动检测演唱技巧有助于理解每位歌手如何表达表演,但由于演唱技巧种类繁多,这也可能是困难的。深度神经网络(DNN)模型可处理此类多样性;然而,考虑数据特征或许能提升演唱技巧检测的性能。本文中我们提出PrimaDNN,一种具有面向特征改进的CRNN模型。该模型的特征为:1)基于辅助音高信息与多分辨率梅尔谱图的输入特征表示,2)基于Squeeze-and-excitation(SENet)与实例归一化的卷积模块。在J-POP演唱技巧检测的结果中,PrimaDNN以总体宏F值44.9%取得相比以往工作的最佳结果。我们还发现各组件的贡献因演唱技巧类型而异。
引用
@article{arxiv.2306.14191,
title = {PrimaDNN': A Characteristics-aware DNN Customization for Singing Technique Detection},
author = {Yuya Yamamoto and Juhan Nam and Hiroko Terasawa},
journal= {arXiv preprint arXiv:2306.14191},
year = {2023}
}
备注
Accepted at EUSIPCO 2023