中文

A2SB:音频到音频 Schrodinger 桥

声音 2025-08-14 v2 机器学习 音频与语音处理

摘要

现实世界的音频常受多种因素影响。本工作提出一种针对44.1kHz高分辨率音乐的音频修复模型。我们的模型,音频到音频 Schrodinger 桥(A2SB),能够实现带宽扩展(预测高频成分)和图像处理(再生缺失片段)。关键的是,A2SB是端到端的,无需声码器即可预测波形输出,能够处理时长为数小时的音频输入,并在宽容许可的音乐数据上进行训练。A2SB在多个离分布音乐测试集上实现了最先进的带宽扩展和图像处理质量。

关键词

引用

@article{arxiv.2501.11311,
  title  = {A2SB: Audio-to-Audio Schrodinger Bridges},
  author = {Zhifeng Kong and Kevin J Shih and Weili Nie and Arash Vahdat and Sang-gil Lee and Joao Felipe Santos and Ante Jukic and Rafael Valle and Bryan Catanzaro},
  journal= {arXiv preprint arXiv:2501.11311},
  year   = {2025}
}