通过参数立体声生成实现单声道到立体声转换
声音
2023-06-27 v1 机器学习
音频与语音处理
摘要
从单声道音频信号生成立体声呈现是一项具有挑战性的开放任务,尤其在目标是获得具有特定声像定位的逼真空间成像时。本工作中,我们提出通过预测参数立体声(PS)参数来实现单声道到立体声的转换,所用方法包括最近邻与深度网络两种途径。结合 PS,我们还提出以生成式方法对该任务建模,从而可从同一单声道信号合成多个且同等合理的立体声渲染版本。为此,我们考虑了自回归与掩码词元建模两种途径。我们提供的证据表明,所提基于 PS 的模型优于一个有竞争力的经典去相关基线,并且在 PS 预测框架内,现代生成模型胜过同等非生成对应模型。总体而言,我们的工作将 PS 与生成建模定位为单声道到立体声上混音的强劲且具吸引力的方法论。我们也讨论了这些方法的局限性。
引用
@article{arxiv.2306.14647,
title = {Mono-to-stereo through parametric stereo generation},
author = {Joan Serrà and Davide Scaini and Santiago Pascual and Daniel Arteaga and Jordi Pons and Jeroen Breebaart and Giulio Cengarle},
journal= {arXiv preprint arXiv:2306.14647},
year = {2023}
}
备注
7 pages, 1 figure; accepted for ISMIR23