中文

Apollo:面向高质量音频修复的频带序列建模

声音 2025-01-08 v2 人工智能 音频与语音处理

摘要

音频修复在现代社会中变得越来越重要,这不仅是因为先进的播放设备带来了对高质量听觉体验的需求,还因为生成式音频模型日益增长的能力需要高保真音频。通常,音频修复被定义为从受损输入中预测未失真音频的任务,常使用 GAN 框架进行训练以平衡感知和失真。由于音频退化主要集中在中频和高频范围,尤其是由编解码器引起的,一个关键挑战在于设计一个能够保留低频信息同时精确重建高质量中高频内容的生成器。受近期高采样率音乐分离、语音增强和音频编解码器模型进展的启发,我们提出了 Apollo,一个专为高采样率音频修复设计的生成模型。Apollo 采用显式频带分割模块来建模不同频带之间的关系,从而实现更连贯、更高质量的修复音频。在 MUSDB18-HQ 和 MoisesDB 数据集上的评估表明,Apollo 在各种比特率和音乐流派下均持续优于现有的 SR-GAN 模型,尤其在涉及多种乐器和人声混合的复杂场景中表现出色。Apollo 在保持计算效率的同时显著提升了音乐修复质量。Apollo 的源代码已公开于 https://github.com/JusperLee/Apollo。

关键词

引用

@article{arxiv.2409.08514,
  title  = {Apollo: Band-sequence Modeling for High-Quality Audio Restoration},
  author = {Kai Li and Yi Luo},
  journal= {arXiv preprint arXiv:2409.08514},
  year   = {2025}
}

备注

Accepted by ICASSP 2025, Demo Page: https://cslikai.cn/Apollo