学习稀疏性以实现高效且有效的音乐表演问答
声音
2025-06-03 v1 计算机视觉与模式识别
多媒体
音频与语音处理
摘要
音乐表演以密集连续的音频以及无缝的视听融合为特征,对多模态场景理解和推理提出了独特的挑战。近期提出的音乐表演视听问答数据集反映了这些挑战,突显了在复杂问答中持续需要更有效地融合视听表征。然而,现有的 Music AVQA 方法通常依赖密集且未优化的表征,导致在关键信息隔离、冗余减少和关键样本优先级排序方面效率低下。为了应对这些挑战,我们引入了 Sparsify,一个专为 Music AVQA 设计的稀疏学习框架。它将三种稀疏化策略集成到端到端流程中,并在 Music AVQA 数据集上取得了最先进的性能。此外,与完全训练的密集对应模型相比,它在保持准确率的同时将训练时间减少了 28.32%,展示了明显的效率提升。为了进一步提高数据效率,我们提出了一种关键子集选择算法,该算法选择并使用约 25% 的 MUSIC-AVQA v2.0 训练数据,并在不同模型中保留了 70-80% 的全量数据性能。
引用
@article{arxiv.2506.01319,
title = {Learning Sparsity for Effective and Efficient Music Performance Question Answering},
author = {Xingjian Diao and Tianzhen Yang and Chunhui Zhang and Weiyi Wu and Ming Cheng and Jiang Gui},
journal= {arXiv preprint arXiv:2506.01319},
year = {2025}
}
备注
Accepted to the main conference of the 63rd Annual Meeting of the Association for Computational Linguistics (ACL 2025)