利用神经表示进行音频处理
音频与语音处理
2023-04-11 v1 声音
摘要
我们研究使用基于预训练神经网络的自编码器作为传统信号处理方法的替代来进行音频处理,因为前者可能提供更好的语义或感知组织。为确立该方法的潜力,我们首先确认这些模型的表示是否编码了关于处理操作的信息。我们使用来自两个不同预训练自编码器的表示进行了实验并生成了可视化。我们的发现表明,虽然关于音频处理操作的某些信息被编码,但该信息有限且以非平凡方式编码。我们尝试可视化这些表示也支持这一点,其表明常见处理操作的表示轨迹通常是非线性的且依赖于内容,即便是线性信号操作也是如此。因此,尚不清楚这些预训练自编码器如何用于操纵音频信号,然而我们的结果表明这可能是由于缺乏对常见音频处理操作的解耦。
引用
@article{arxiv.2304.04394,
title = {Leveraging Neural Representations for Audio Manipulation},
author = {Scott H. Hawley and Christian J. Steinmetz},
journal= {arXiv preprint arXiv:2304.04394},
year = {2023}
}
备注
Accepted as Express Paper for AES Europe 2023, https://aeseurope.com/