中文

基于码本的音频特征表示用于音乐信息检索

信息检索 2016-11-15 v1 机器学习 多媒体

摘要

近几十年来,数字音乐在网络上变得极为丰富。自动推荐系统对于用户发现喜爱的音乐以及艺术家触达合适的听众至关重要。当缺乏人工标注和用户偏好数据时(例如对于新艺术家),这些系统必须依赖基于内容的方法。除了用于分类和检索的强大机器学习工具外,成功推荐的一个关键组成部分是音频内容表示。好的表示应能捕捉歌曲音频信号中富有信息量的音乐模式。这些表示应当简洁,以便实现对海量音乐库的高效管理(低存储、易于索引、快速搜索),并且应当易于快速计算,以实现与向系统提供新歌曲的用户进行实时交互。在设计新的音频特征之前,我们探索了传统局部特征的使用,同时增加了一个使用预计算码本进行编码的阶段和一个池化阶段以获得紧凑的向量表示。我们实验了不同的编码方法,即LASSO、矢量量化(VQ)和余弦相似度(CS)。我们在两个音乐信息检索应用中评估了表示的质量:基于标签的查询和基于示例的查询。我们的结果表明,紧凑的表示可以在两个应用中都取得成功的性能。我们推荐使用top-τ VQ编码,该方法在两个应用中均表现一致良好,且所需的计算时间远少于LASSO。

关键词

引用

@article{arxiv.1312.5457,
  title  = {Codebook based Audio Feature Representation for Music Information Retrieval},
  author = {Yonatan Vaizman and Brian McFee and Gert Lanckriet},
  journal= {arXiv preprint arXiv:1312.5457},
  year   = {2016}
}

备注

Journal paper. Submitted to IEEE transactions on Audio, Speech and Language Processing. Submitted on Dec 18th, 2013