中文

面向图像与音频音乐转录的后期多模态融合

多媒体 2022-08-29 v3 计算机视觉与模式识别 信息检索 声音 音频与语音处理

摘要

音乐转录旨在将音乐源转换为结构化数字格式,是音乐信息检索(MIR)中的关键问题。在计算层面应对该挑战时,MIR 社区遵循两条研究路线:音乐文档(即光学音乐识别 OMR 的情况)或音频录音(即自动音乐转录 AMT 的情况)。上述输入数据的不同性质使得这些领域发展出特定于模态的框架。然而,它们近期被定义为序列标注任务,从而导向一种共同的输出表示,这使得对组合范式的研究成为可能。就此而言,图像与音频多模态音乐转录包含了有效融合图像与音频模态所传达信息的挑战。在本工作中,我们在后期融合层面探索该问题:我们研究了四种组合方法,以首次在基于格的搜索空间中合并端到端 OMR 与 AMT 系统的假设。在一系列性能场景下——对应的单模态模型产生不同错误率——所获得的结果显示了这些方法的显著益处。此外,所考虑的四种策略中有两种显著改进了相应的单模态标准识别框架。

关键词

引用

@article{arxiv.2204.03063,
  title  = {Late multimodal fusion for image and audio music transcription},
  author = {María Alfaro-Contreras and Jose J. Valero-Mas and José M. Iñesta and Jorge Calvo-Zaragoza},
  journal= {arXiv preprint arXiv:2204.03063},
  year   = {2022}
}