聆听特征
声音
2015-01-22 v1
摘要
这项工作探索了旨在从音乐信息检索(MIR)框架中通常使用的低维声学特征合成音频的非参数方法。几个问题阻碍了这项任务的直接实现。此类特征是为分析而非合成设计的,因此倾向于高层描述而非易于反演的声学表示。虽然一些先前的研究已经考虑了从梅尔频率倒谱系数(Mel-Frequency Cepstral Coefficients)等特征合成音频的问题,但它们主要依赖于用于计算这些特征的显式公式来进行反演。在这里,我们采用一种简单的盲方法,其中可以在合成期间使用任意特征集,并且重建是基于示例的。在从众所周知的特征问题进行语音合成测试后,我们将该方法应用于更复杂的任务,即反演百万歌曲数据集(Million Song Dataset)中的歌曲。使这项任务更难的原因有两点。首先,特征根据基于起音的分段在时域中不规则分布。其次,用于计算这些特征的确切方法未知,尽管新音频的特征可以使用其 API 作为黑盒进行计算。在本文中,我们详细说明了这些困难,并提出了一个框架,尽管如此仍尝试通过连接训练数据集中的音频样本来进行此类合成,这些样本的特征已预先计算好。样本是在特征空间中以段为单位选择的,使用简单的最近邻搜索。然后可以定义额外的约束以增强合成的相关性。我们展示了使用 RWC 和 GTZAN 音频数据集从百万歌曲数据集合成轨道的初步实验。
引用
@article{arxiv.1501.04981,
title = {Listening to features},
author = {Manuel Moussallam and Antoine Liutkus and Laurent Daudet},
journal= {arXiv preprint arXiv:1501.04981},
year = {2015}
}
备注
Technical Report