SonicMaster:面向可控全方位音乐修复与混音的系统
声音
2026-05-06 v3 人工智能
多媒体
音频与语音处理
摘要
音乐录音常常因遇到音频质量问题,如过度混响、失真、削波、声部失衡和立体声图像收窄等,尤其在非专业环境下且缺乏专业设备和 expertise 时更为常见。这些问题通常需要使用专门的工具和手动调整进行纠正。本文介绍 SonicMaster,这是第一个针对广泛音频伪影的文本控制统一生成模型,用于音乐修复和混音。SonicMaster 基于自然语言指令进行条件化,以应用针对性的增强,或可 operate 在自动模式进行通用修复。为训练此模型,我们构建了 SonicMaster 数据集,这是一个包含大量已配对的受损和高质量轨道的数据集,通过模拟常见的退化类型并采用十九种属于五组增强函数的退化函数来构建:均衡器、动态、混响、幅值和立体声。我们的方法利用流匹配生成训练范式来学习一种音频转换,将受损输入映射到其已修复、混音后的版本,由文本提示引导。客观音频质量指标表明,SonicMaster 在所有伪影类别上显著提升了声音质量。此外,主观听感测试确认,听众更倾向于选择 SonicMaster 的增强输出相对于其他基线方法。
引用
@article{arxiv.2508.03448,
title = {SonicMaster: Towards Controllable All-in-One Music Restoration and Mastering},
author = {Jan Melechovsky and Ambuj Mehrish and Abhinaba Roy and Dorien Herremans},
journal= {arXiv preprint arXiv:2508.03448},
year = {2026}
}