面向音乐视听问答的查询引导时空频交互方法
计算机视觉与模式识别
2026-03-10 v2
摘要
视听问答 (Audio-Visual Question Answering, AVQA) 是一项具有挑战性的多模态任务,要求在给定视频中对音频、视觉和文本信息进行联合推理以回答自然语言问题。受视频问答近期进展的启发,许多现有的 AVQA 方法主要关注视觉信息处理,利用预训练模型提取对象级和运动级表示。然而,在这些方法中,音频输入主要被视为视频分析的补充,而文本问题信息对视听理解的贡献极小,因为它通常仅在推理的最后阶段被整合。为了解决这些局限性,我们提出了一种新颖的查询引导时空频 (Query-guided Spatial-Temporal-Frequency, QSTar) 交互方法,该方法有效结合了查询引导线索,并利用音频信号独特的频域特征以及空间和时间感知来增强视听理解。此外,我们引入了一个受提示启发的查询上下文推理 (Query Context Reasoning, QCR) 模块,该模块引导模型更精确地关注语义相关的音频和视觉特征。在多个 AVQA 基准上进行的大量实验证明了我们提出方法的有效性,与现有的音频问答、视觉问答、视频问答和 AVQA 方法相比取得了显著的性能提升。代码和预训练模型将在发表后发布。
引用
@article{arxiv.2601.19821,
title = {Query-Guided Spatial-Temporal-Frequency Interaction for Music Audio-Visual Question Answering},
author = {Kun Li and Michael Ying Yang and Sami Sebastian Brandt},
journal= {arXiv preprint arXiv:2601.19821},
year = {2026}
}
备注
Accepted to ICLR 2026