中文

MIR 中用于音乐流派识别的一种新型音频表示

声音 2024-04-02 v1 信息检索 机器学习 音频与语音处理

摘要

对于音乐信息检索(MIR)的下游任务,最常见的音频表示是基于时频的,例如梅尔频谱图。为了识别音乐流派,本研究探索了一种新型音频表示在最常见 MIR 下游任务之一中的可能性。因此,通过使用深度向量量化对音乐进行离散编码;为创新的生成式音乐模型即 Jukebox 创建了一种新型音频表示。使用几乎等同于 State-of-the-Art (SOTA) 的数据集和几乎相同的 Transformer 设计,将 Jukebox 的音频表示与梅尔频谱图进行了比较。本研究的结果表明,至少在 Transformer 使用包含 2 万首曲目的非常小的数据集进行预训练时,Jukebox 的音频表示并不优于梅尔频谱图。这可以解释为 Jukebox 的音频表示没有充分考虑人类听觉感知的特殊性。另一方面,梅尔频谱图是专门针对人类听觉感官而创建的。

关键词

引用

@article{arxiv.2404.01058,
  title  = {A Novel Audio Representation for Music Genre Identification in MIR},
  author = {Navin Kamuni and Mayank Jindal and Arpita Soni and Sukender Reddy Mallreddy and Sharath Chandra Macha},
  journal= {arXiv preprint arXiv:2404.01058},
  year   = {2024}
}