基于单独乐器声音的音乐相似性表示学习:利用源分离与人类偏好
声音
2025-03-25 v1 音频与语音处理
摘要
本文提出一种基于单个乐器声音(InMSRL)的音乐相似性表示学习方法,利用音乐源分离(MSS)和人类偏好,无需在推断阶段使用干净的乐器声音。我们提出了三种有效提升性能的方法。首先,我们引入了针对级联方法的端到端微调(E2E-FT),该方法依次执行音乐源分离和音乐相似性特征提取。E2E-FT允许模型最小化分离误差对特征提取的负面影响。其次,我们为直接方法提出多任务学习,利用单一的音乐相似性特征提取器直接提取解耦的音乐相似性特征。基于解耦的音乐相似性特征提取和基于解耦音乐相似性特征的重建的多任务学习进一步增强了乐器特征的解耦。最后,我们采用感知感知微调(PAFT)。PAFT利用人类偏好,使模型能够进行与人类感知相似性相匹配的InMSRL。我们进行了实验评估,结果表明:1)针对级联方法的E2E-FT显著性地改进了InMSRL性能;2)针对直接方法的多任务学习对特征提取中的解耦性能也有帮助;3)PAFT显著性地增强了感知InMSRL性能;4)采用E2E-FT和PAFT的级联方法优于采用多任务学习和PAFT的直接方法。
引用
@article{arxiv.2503.18486,
title = {Music Similarity Representation Learning Focusing on Individual Instruments with Source Separation and Human Preference},
author = {Takehiro Imamura and Yuka Hashizume and Wen-Chin Huang and Tomoki Toda},
journal= {arXiv preprint arXiv:2503.18486},
year = {2025}
}