SAGA-SR:语义与声学引导的音频超分辨率
音频与语音处理
2025-09-30 v1
摘要
通用音频超分辨率(SR)旨在为语音、音乐和音效等不同领域的低分辨率音频预测高频分量。现有的基于扩散的SR方法通常无法产生语义对齐的输出,且难以实现一致的高频重建。在本文中,我们提出SAGA-SR,一种结合语义与声学引导的通用音频SR模型。基于以流匹配目标训练的DiT骨干网络,SAGA-SR以文本与频谱滚降嵌入为条件。得益于其条件提供的有效引导,SAGA-SR能够稳健地将4 kHz至32 kHz之间任意输入采样率的音频上采样至44.1 kHz。客观与主观评估均表明,SAGA-SR在所有测试用例中均取得了SOTA性能。所提模型的音频示例与代码已在线提供。
引用
@article{arxiv.2509.24924,
title = {SAGA-SR: Semantically and Acoustically Guided Audio Super-Resolution},
author = {Jaekwon Im and Juhan Nam},
journal= {arXiv preprint arXiv:2509.24924},
year = {2025}
}
备注
5 pages, 3 figures