合成多样且高质量的音频纹理
声音
2018-06-22 v1 音频与语音处理
摘要
基于匹配神经网络中特征激活的Gram矩阵在图像领域取得了惊人成功的纹理合成技术。本文将此类技术推广至音频领域。我们表明合成多样的音频纹理具有挑战性,并论证其原因在于音频数据维度相对较低。因此我们向原始Gram损失引入两项新项:保留节奏的自相关项,以及促使优化过程合成独特纹理的多样性项。我们通过引入Inception损失的音频类比(称之为VGGish损失)定量研究了设计选择对合成音频质量的影响。我们展示了使用该技术时合成音频的多样性与质量之间存在权衡。此外我们进行了若干实验以定性研究这些设计选择如何影响合成音频的质量。最后我们描述了这些结果对音频风格迁移问题的意义。
引用
@article{arxiv.1806.08002,
title = {Synthesizing Diverse, High-Quality Audio Textures},
author = {Joseph Antognini and Matt Hoffman and Ron J. Weiss},
journal= {arXiv preprint arXiv:1806.08002},
year = {2018}
}
备注
10 pages, submitted to TASLP