深度音频先验
声音
2019-12-24 v1 机器学习
音频与语音处理
机器学习
摘要
深度卷积神经网络以从大量数据中提炼紧凑且鲁棒的先验而闻名。我们致力于在无训练数据集的情况下应用深度网络。本文引入深度音频先验(DAP),其利用了网络的结构与单个音频文件中的时间信息。具体而言,我们证明了随机初始化的神经网络可结合精心设计的音频先验,来解决诸如通用盲源分离、交互式音频编辑、音频纹理合成与音频共分离等具有挑战性的音频问题。为理解深度音频先验的鲁棒性,我们构建了基准数据集 Universal-150,用于具有多样化声源的通用声源分离。我们在定性与定量评估上均展现出优于先前工作的音频结果。我们还进行了详尽的消融研究以验证我们的设计选择。
引用
@article{arxiv.1912.10292,
title = {Deep Audio Prior},
author = {Yapeng Tian and Chenliang Xu and Dingzeyu Li},
journal= {arXiv preprint arXiv:1912.10292},
year = {2019}
}