DisMix:用于源级音高和音色分离混合的音乐乐器
声音
2024-08-21 v1 人工智能
机器学习
音频与语音处理
摘要
现有工作在音高和音色解耦方面主要聚焦于单乐器音频,未涵盖多乐器共现的情况。为填补这一空白,我们提出DisMix——一种生成式框架,其中音高和音色表示作为构建旋律和乐器的模块化构件,其集合形成 underlying observed mixture 的每个乐器潜在表示。通过操控这些表示,我们的模型可采样出 novel 组合音高和音色的混合音。我们能够联合学习解耦的音高-音色表示与一个潜在扩散transformer,以给定的源级表示为条件重构混合音。我们使用两种数据集进行评估:一种是简单的数据集包含孤立和弦,另一种是风格化为J.S. Bach的真实四部合唱歌。我们确定解耦成功的关键组件,并展示了基于源级属性操控的混合转换应用。
引用
@article{arxiv.2408.10807,
title = {DisMix: Disentangling Mixtures of Musical Instruments for Source-level Pitch and Timbre Manipulation},
author = {Yin-Jyun Luo and Kin Wai Cheuk and Woosung Choi and Toshimitsu Uesaka and Keisuke Toyama and Koichi Saito and Chieh-Hsin Lai and Yuhta Takida and Wei-Hsiang Liao and Simon Dixon and Yuki Mitsufuji},
journal= {arXiv preprint arXiv:2408.10807},
year = {2024}
}