PHALAR:用于学习音乐音频表示的相量
声音
2026-05-27 v4 人工智能
机器学习
信号处理
摘要
分轨检索(即将缺失的音轨与给定音频子混音进行匹配的任务)是一项关键挑战,目前受限于丢弃时间信息的模型。我们引入了 PHALAR,这是一个对比学习框架,相较于 state-of-the-art 实现了高达 的相对准确率提升,同时仅需 的参数量以及 7 倍的训练加速。通过利用 Learned Spectral Pooling 层和复值头,PHALAR 强制施加音高等变和相位等变偏置。PHALAR 在 MoisesDB、Slakh 和 ChocoChorales 上确立了新的检索 state-of-the-art,与人类连贯性判断的相关性显著高于语义基线。最后,零拍节拍跟踪和线性和弦探测证实,PHALAR 捕获了超越检索任务的鲁棒音乐结构。
引用
@article{arxiv.2605.03929,
title = {PHALAR: Phasors for Learned Musical Audio Representations},
author = {Davide Marincione and Michele Mancusi and Giorgio Strano and Luca Cerovaz and Donato Crisostomi and Roberto Ribuoli and Emanuele Rodolà},
journal= {arXiv preprint arXiv:2605.03929},
year = {2026}
}
备注
Accepted at ICML 2026