BNMusic:将环境噪声融入个性化音乐
声音
2026-02-02 v3 人工智能
音频与语音处理
摘要
在受到环境噪声干扰时,声学掩蔽技术是音频工程中一种传统的减少干扰的方法,旨在用其他更主导但干扰较小的声音来覆盖噪声。然而,主导声音与噪声之间的不匹配——例如节拍不一致——通常需要大幅增加音量才能实现有效掩蔽。受跨模态生成最新进展的启发,在本工作中,我们提出了一种替代声学掩蔽的方法,旨在通过将环境噪声融入基于用户提供的文本提示生成的个性化音乐中来降低噪声的可察觉性。遵循使用梅尔频谱图表示进行音乐生成的范式,我们提出了一个将噪声融入个性化音乐(BNMusic)框架,包含两个关键阶段。第一阶段合成一段完整的音乐,以梅尔频谱图表示形式捕捉噪声的音乐本质。第二阶段,我们自适应地放大生成的音乐片段,以进一步降低噪声感知并增强融合效果,同时保持听觉质量。我们在 MusicBench、EPIC-SOUNDS 和 ESC-50 上进行了全面的实验评估,证明了该框架的有效性,展示了将环境噪声与节奏对齐、自适应放大且令人愉悦的音乐片段融合的能力,最大程度降低噪声的可察觉性,从而改善整体声学体验。项目页面:https://d-fas.github.io/BNMusic_page/.
引用
@article{arxiv.2506.10754,
title = {BNMusic: Blending Environmental Noises into Personalized Music},
author = {Chi Zuo and Martin B. Møller and Pablo Martínez-Nuevo and Huayang Huang and Yu Wu and Ye Zhu},
journal= {arXiv preprint arXiv:2506.10754},
year = {2026}
}
备注
This paper has been accepted by NeurIPS 2025