通过附加关键音视频线索的文本回答多样化问题
计算机视觉与模式识别
2024-03-12 v1
摘要
音视频问答(AVQA)需要参考视频内容和听觉信息,然后将问题关联起来以预测最精确的答案。尽管挖掘更深层次的音视频信息以与问题交互有助于多模态融合过程,但音视频参数的冗余往往会降低推理引擎对单个视频中多个问答对的泛化能力。实际上,音视频与文本之间的自然异质关系使得完美融合具有挑战性。为了防止高层音视频语义削弱网络对多样化问题类型的适应性,我们提出了一个执行互相关蒸馏(MCD)的框架来辅助问题推理。MCD分为三个主要步骤:1)首先,利用残差结构增强基于自注意力的音视频软关联,然后通过共享聚合器分层捕获与问题上下文相关的关键局部音视频特征,并以线索的形式与特定问题向量耦合。2)其次,强制执行知识蒸馏,在共享潜在空间中对齐音视频-文本对,以缩小跨模态语义差距。3)最后,通过丢弃决策级集成来解耦音视频依赖关系。我们在两个包含多个问答对的公开数据集(即Music-AVQA和AVQA)上评估了所提出的方法。实验表明,我们的方法优于其他最先进的方法,其背后的一个有趣发现是,在推理过程中移除深层音视频特征可以有效缓解过拟合。源代码发布在 http://github.com/rikeilong/MCD-forAVQA。
引用
@article{arxiv.2403.06679,
title = {Answering Diverse Questions via Text Attached with Key Audio-Visual Clues},
author = {Qilang Ye and Zitong Yu and Xin Liu},
journal= {arXiv preprint arXiv:2403.06679},
year = {2024}
}