用于音视频问答的提问感知高斯专家
计算机视觉与模式识别
2025-06-12 v3
摘要
音视频问答(AVQA)不仅需要基于问题的多模态推理,还需要精确的时间定位以捕捉细微动态,从而实现准确预测。然而,现有方法主要隐式地使用问题信息,限制了对问题特定细节的关注。此外,大多数研究依赖均匀帧采样,可能遗漏关键的问题相关帧。尽管近期的 Top-K 帧选择方法旨在解决这一问题,但其离散特性仍忽略了细粒度的时间细节。本文提出 QA-TIGER,一个新颖的框架,明确融入问题信息并建模连续时间动态。我们的核心思想是利用基于高斯的建模,根据问题自适应地聚焦于连续和非连续帧,同时显式注入问题信息并应用渐进细化。我们利用专家混合来灵活实现多个高斯模型,激活专门针对问题的时间专家。在多个 AVQA 基准上的广泛实验表明 QA-TIGER 持续达到最先进性能。代码可在 https://aim-skku.github.io/QA-TIGER/ 获取。
引用
@article{arxiv.2503.04459,
title = {Question-Aware Gaussian Experts for Audio-Visual Question Answering},
author = {Hongyeob Kim and Inyoung Jung and Dayoon Suh and Youjia Zhang and Sangmin Lee and Sungeun Hong},
journal= {arXiv preprint arXiv:2503.04459},
year = {2025}
}
备注
CVPR 2025. Code is available at https://github.com/AIM-SKKU/QA-TIGER