中文

回归听觉:感知驱动的高保真音乐重建

声音 2025-11-07 v2 人工智能

摘要

变分自编码器(VAE)对于大规模音频任务(如基于扩散的生成)至关重要。然而,现有的开源模型在训练过程中往往忽略听觉感知方面,导致相位精度和立体声空间表示方面的弱点。为应对这些挑战,我们提出了εar-VAE,一个重新思考并优化VAE训练范式的开源音乐信号重建模型。我们的贡献有三:(i)在损失计算之前应用K加权感知滤波器,使目标与听觉感知对齐。(ii)两种新型相位损失:用于立体声一致性的相关性损失,以及使用其导数——瞬时频率和群延迟——的相位损失,以实现高精度。(iii)一种新的谱监督范式,其中幅度由全部四个Mid/Side/Left/Right分量监督,而相位仅由LR分量监督。实验表明,εar-VAE在44.1kHz下在多种指标上大幅优于领先的开源模型,在重建高频谐波和空间特性方面表现出特别优势。

关键词

引用

@article{arxiv.2509.14912,
  title  = {Back to Ear: Perceptually Driven High Fidelity Music Reconstruction},
  author = {Kangdi Wang and Zhiyue Wu and Dinghao Zhou and Rui Lin and Junyu Dai and Tao Jiang},
  journal= {arXiv preprint arXiv:2509.14912},
  year   = {2025}
}

备注

Check the Code here: https://github.com/Eps-Acoustic-Revolution-Lab/EAR_VAE and Model Weights here: https://huggingface.co/earlab/EAR_VAE