中文

学习稀疏性以实现高效且有效的音乐表演问答

声音 2025-06-03 v1 计算机视觉与模式识别 多媒体 音频与语音处理

摘要

音乐表演以密集连续的音频以及无缝的视听融合为特征,对多模态场景理解和推理提出了独特的挑战。近期提出的音乐表演视听问答数据集反映了这些挑战,突显了在复杂问答中持续需要更有效地融合视听表征。然而,现有的 Music AVQA 方法通常依赖密集且未优化的表征,导致在关键信息隔离、冗余减少和关键样本优先级排序方面效率低下。为了应对这些挑战,我们引入了 Sparsify,一个专为 Music AVQA 设计的稀疏学习框架。它将三种稀疏化策略集成到端到端流程中,并在 Music AVQA 数据集上取得了最先进的性能。此外,与完全训练的密集对应模型相比,它在保持准确率的同时将训练时间减少了 28.32%,展示了明显的效率提升。为了进一步提高数据效率,我们提出了一种关键子集选择算法,该算法选择并使用约 25% 的 MUSIC-AVQA v2.0 训练数据,并在不同模型中保留了 70-80% 的全量数据性能。

关键词

引用

@article{arxiv.2506.01319,
  title  = {Learning Sparsity for Effective and Efficient Music Performance Question Answering},
  author = {Xingjian Diao and Tianzhen Yang and Chunhui Zhang and Weiyi Wu and Ming Cheng and Jiang Gui},
  journal= {arXiv preprint arXiv:2506.01319},
  year   = {2025}
}

备注

Accepted to the main conference of the 63rd Annual Meeting of the Association for Computational Linguistics (ACL 2025)