AV-Master:基于双路径综合感知提升音视频问答
计算机视觉与模式识别
2026-04-28 v2
摘要
音视频问答 (AVQA) 需要模型有效地利用视觉和听觉两种模态来回答关于音视频场景的复杂且多样化的问题。然而,现有方法在时间采样和模态偏好意识方缺乏足够的灵活性和动态适应性,难以根据问题聚焦于关键信息。这限制了其在复杂情境下的推理能力。为此,我们提出一种名为 AV-Master 的新型框架。它通过动态建模时间和模态两个维度来增强模型从复杂音视频场景中(包含大量冗余内容)提取关键信息的能力。在时间维度,我们引入一种动态自适应聚焦采样机制,逐步聚焦于与问题最相关的音视频片段,有效缓解了传统采样方法中的片段碎片化问题。在模态维度,我们提出一种偏好感知策略,独立建模每个模态的贡献,实现关键特征的选择性激活。此外,我们引入一种双路径对比损失,以强化时间和模态维度上的一致性与互补性,引导模型学习问题特定的跨模态协作表示。在四个大型基准数据集上的实验表明,AV-Master显著优于现有方法,尤其在复杂推理任务中表现突出。
引用
@article{arxiv.2510.18346,
title = {AV-Master: Dual-Path Comprehensive Perception Makes Better Audio-Visual Question Answering},
author = {Jiayu Zhang and Shuo Ye and Qilang Ye and Xun Lin and Zihan Song and Zitong Yu},
journal= {arXiv preprint arXiv:2510.18346},
year = {2026}
}