声节万物:基于掩码语言模型的音频提示鼓乐生成
声音
2025-09-22 v1 音频与语音处理
摘要
音乐家和非音乐家都会使用节奏声部 gestures(如拍手、嘴打鼓)来表达鼓模式。虽然这些 gestures 有效地传递音乐思想,但将这些想法实现为完整的鼓录制可能需要大量时间,可能会干扰许多创意工作流程。为弥合这一差距,我们提出 TRIA(The Rhythm In Anything),这是一种用于将节奏声部 gestures 映射到高保真鼓录制的掩码变换模型。给定表示所需节奏模式的音频提示以及表示鼓组 timbre 的第二个提示,TRIA 将生成一段鼓组演奏所需节奏(带有适当的润色)并呈现所需 timbre 的音频。主观和客观评估表明,基于不到 10 小时公开可用的鼓数据训练的 TRIA 模型能够以零样本方式生成高质量、忠实于声部 gestures 的音频输出,覆盖广泛的 timbre 范围。
引用
@article{arxiv.2509.15625,
title = {The Rhythm In Anything: Audio-Prompted Drums Generation with Masked Language Modeling},
author = {Patrick O'Reilly and Julia Barnett and Hugo Flores García and Annie Chu and Nathan Pruyne and Prem Seetharaman and Bryan Pardo},
journal= {arXiv preprint arXiv:2509.15625},
year = {2025}
}
备注
ISMIR 2025