中文

学习解耦音乐表征用于音频相似性-MERIT

声音 2026-05-27 v1

摘要

当前音乐相似性模型通常计算单个单子化分数,将旋律、节奏和音色等不同音乐维度纠缠在一起。这限制了用户的控制和可解释性,无法执行细微查询。我们引入MERIT,一个用于学习解耦、按因子特定音乐表征的框架,以针对这三个核心维度进行建模。为了克服现实世界音频中缺乏单因子变体的困境,我们采用一种新颖的训练策略,使用条件音频生成和源分离的干扰声来强烈鼓励训练数据中的单因子变体。我们的评估显示,因子级解耦效果显著。每个头部对其预期感知维度都有强烈响应,而对其他维度则接近随机,一种贴合跨合成训练领域和独立现实世界音频的表征属性。

关键词

引用

@article{arxiv.2605.27346,
  title  = {MERIT: Learning Disentangled Music Representations for Audio Similarity},
  author = {Abhinaba Roy and Junyi Liang and Dorien Herremans},
  journal= {arXiv preprint arXiv:2605.27346},
  year   = {2026}
}