中文

面向音乐乐器和合成器检索的对比时域表示

声音 2025-09-17 v1 人工智能

摘要

从音频混合信号中高效检索特定乐器音色仍是数字音乐制作中的挑战。本文引入一种对比学习框架,用于音乐乐器检索,使该框架能够使用单个模型同时处理单乐器和多乐器声音。我们提出了技术方案,用于生成虚拟音乐乐器(如采样器和合成器)的真实正/负声音对,解决了常见音频数据增强方法的局限性。第一个实验聚焦于从3,884个乐器的数据集中检索单个乐器,使用单乐器音频作为输入。对比方法在基于分类预训练的先前工作方面表现相当。第二个实验考虑以多个乐器混合音为音频输入的情况。此时,所提出的对比框架超越了相关工作,实现了三个乐器混合音的top-1准确率为81.7%,top-5准确率为95.7%。

关键词

引用

@article{arxiv.2509.13285,
  title  = {Contrastive timbre representations for musical instrument and synthesizer retrieval},
  author = {Gwendal Le Vaillant and Yannick Molle},
  journal= {arXiv preprint arXiv:2509.13285},
  year   = {2025}
}