Essentia 中的 TensorFlow 音频模型
音频与语音处理
2020-03-18 v1 机器学习
声音
摘要
Essentia 是一个用于音频与音乐分析的知名开源 C++/Python 库。在本工作中,我们提出一组在 Essentia 中使用 TensorFlow 的算法,可利用预训练深度学习模型进行预测,并旨在提供使用的灵活性、易于扩展性以及实时推理。为展示这一 TensorFlow 新接口的潜力,我们提供了若干预训练的最先进音乐标注与分类 CNN 模型。我们对所开发的模型进行了广泛评估。特别地,我们利用外部标注数据集以及针对我们模型分类体系定制的手动标注,在跨数据集评估中考察其泛化能力。
引用
@article{arxiv.2003.07393,
title = {TensorFlow Audio Models in Essentia},
author = {Pablo Alonso-Jiménez and Dmitry Bogdanov and Jordi Pons and Xavier Serra},
journal= {arXiv preprint arXiv:2003.07393},
year = {2020}
}