作为链接预测的 Musical Voice Separation:将音乐感知任务建模为多轨迹跟踪问题
声音
2023-05-01 v1 人工智能
机器学习
音频与语音处理
摘要
本文针对在复调音乐作品中分离不同交互声部(即单声部旋律流)的感知任务。我们针对符号音乐,其中音符被显式编码,并将该任务建模为来自离散观测(即音高-时间空间中的音符)的多轨迹跟踪(MTT)问题。我们的方法从音乐作品构建图,为每个音符创建一个节点,并通过若两个音符在同一声部/流中连续则预测它们之间存在链接来分离旋律轨迹。这种局部、贪婪的预测由异构图神经网络创建的节点嵌入实现,该嵌入能捕获轨迹间与轨迹内信息。此外,我们提出一种新的正则化损失,鼓励输出尊重每个节点至多一个传入和一个传出链接的 MTT 前提, favoring 单声部(声部)轨迹;该损失函数也可能在其他一般 MTT 场景中可用。我们的方法不使用领域特定启发式,可扩展到更长序列和更多声部数,并能处理如声部倒置与重叠的复杂情况。我们在不同风格的古典音乐声部分离任务上达到了新的 SOTA 结果。
引用
@article{arxiv.2304.14848,
title = {Musical Voice Separation as Link Prediction: Modeling a Musical Perception Task as a Multi-Trajectory Tracking Problem},
author = {Emmanouil Karystinaios and Francesco Foscarin and Gerhard Widmer},
journal= {arXiv preprint arXiv:2304.14848},
year = {2023}
}
备注
Accepted at the 32nd International Joint Conference on Artificial Intelligence (IJCAI-23)