中文

Fx-Encoder++:从混音中提取分乐器音频效果表示

声音 2025-07-04 v1 音频与语音处理

摘要

通用音频表示在多种音乐信息检索应用中已被证明有效,但由于对音频效果理解不足,其在智能音乐制作中的效用仍然受限。尽管先前的方法强调在混音层面进行音频效果分析,但这种关注对于需要分乐器音频效果理解的任务(如自动混音)来说是不够的。在这项工作中,我们提出了 Fx-Encoder++,一种旨在从音乐混音中提取分乐器音频效果表示的新模型。我们的方法利用对比学习框架,并引入了一种“提取器”机制,当提供乐器查询(音频或文本)时,该机制将混音层面的音频效果嵌入转换为分乐器音频效果嵌入。我们在检索和音频效果参数匹配任务中评估了我们的模型,测试了其在多种乐器上的性能。结果表明,Fx-Encoder++ 在混音层面优于先前的方法,并展示了一种提取分乐器效果表示的新能力,填补了智能音乐制作系统中的关键能力空白。

关键词

引用

@article{arxiv.2507.02273,
  title  = {Fx-Encoder++: Extracting Instrument-Wise Audio Effects Representations from Mixtures},
  author = {Yen-Tung Yeh and Junghyun Koo and Marco A. Martínez-Ramírez and Wei-Hsiang Liao and Yi-Hsuan Yang and Yuki Mitsufuji},
  journal= {arXiv preprint arXiv:2507.02273},
  year   = {2025}
}

备注

ISMIR 2025