学习音乐表征用于音乐演出问答
计算机视觉与模式识别
2025-02-11 v1 多媒体
声音
音频与语音处理
摘要
音乐演出是音频-视觉建模的典型场景。与常见的稀疏音频场景不同,音乐演出贯穿整个过程都伴随着密集的音频信号。虽然现有的多模态学习方法在一般场景中展现了令人印象深刻的能力,但它们无法处理音乐演出中的根本问题:它们未充分探索表演中多模态信号之间的相互作用,未考虑乐器和音乐的独特特征。因此,这些方法倾向于对关于音乐演出的问题给出不准确的答案。为弥合上述研究差距,我们:(i)鉴于音乐数据固有的复杂多模态相互关联性,我们的主要骨干网络设计融合了音乐上下文中的多模态相互作用;(ii)为使模型能够学习音乐特征,我们标注并发布了节奏和音乐来源于当前音乐数据集;(iii)针对时序感知的音频-视觉建模,我们将模型的音乐预测与时间维度对齐。我们的实验显示,在Music AVQA数据集上,我们的方法实现了最先进的效果。我们的代码已公开:https://github.com/xid32/Amuse
引用
@article{arxiv.2502.06710,
title = {Learning Musical Representations for Music Performance Question Answering},
author = {Xingjian Diao and Chunhui Zhang and Tingxuan Wu and Ming Cheng and Zhongyu Ouyang and Weiyi Wu and Jiang Gui},
journal= {arXiv preprint arXiv:2502.06710},
year = {2025}
}
备注
Accepted at EMNLP 2024