音乐超分辨率中时域卷积神经网络的相位修复
声音
2024-02-20 v2 音频与语音处理
摘要
音频超分辨率(SR)是一个重要课题,因为低分辨率录音在日常生活中十分普遍。本文聚焦于音乐SR任务,其因音乐宽广的频率响应与动态范围而具挑战性。许多模型在时域设计以联合处理音频信号的幅度与相位。然而,已有工作表明使用时域卷积神经网络(TD-CNN)的方法往往在其波形输出中产生恼人伪影,且伪影成因尚待确认。据我们所知,本工作首次通过主观实验证明TD-CNN中的伪影由相位失真所致。我们进一步提出时域相位修复(TD-PR),其使用在宽带数据上预训练的神经声码器来修复TD-CNN波形输出中的相位分量。尽管声码器与TD-CNN各自独立训练,所提TD-PR获得了更优平均意见分,显著提升了TD-CNN基线的感知质量。由于所提TD-PR仅修复波形的相位分量,所改善的感知质量反过来表明相位失真正是TD-CNN恼人伪影的成因。此外,单一预训练声码器可直接应用于任意TD-CNN而无需额外适配。因此,我们将TD-PR应用于三种架构与参数量各异的TD-CNN。在全部三个TD-CNN基线上均观察到一致改进。音频样本见于演示页面。
引用
@article{arxiv.2306.11282,
title = {Phase Repair for Time-Domain Convolutional Neural Networks in Music Super-Resolution},
author = {Yenan Zhang and Guilly Kolkman and Hiroshi Watanabe},
journal= {arXiv preprint arXiv:2306.11282},
year = {2024}
}
备注
Under review