中文

基于CLIP的TASS:面向音视频问答的目标感知单流网络

计算机视觉与模式识别 2024-05-14 v1

摘要

虽然视觉语言预训练模型(VLMs)在各种多模态理解任务中表现出色,但其在细粒度音视频推理方面,特别是音视频问答(AVQA)任务中仍被大量未被探索。AVQA 为 VLMs 提出了特定挑战,由于需要进行区域级别的视觉理解,并与音频模态无缝集成。以往的VLM-based AVQA方法仅将CLIP用作特征编码器,未能充分利用其知识,且将音频和视频作为独立实体在双流框架中处理,而大多数AVQA方法也是如此。本文提出了一种新的CLIP驱动的目标感知单流(TASS)网络,用于AVQA,通过利用预训练模型的图像-文本匹配知识,借助其自然的音视频匹配特性。它包含两个关键组件:目标感知空间 grounding 模块(TSG+)和单流联合 temporal grounding 模块(JTG)。具体而言,我们提出的TSG+模块可在没有对应 ground-truth标签的情况下,将CLIP模型的图像-文本匹配知识传递给我们的区域-文本匹配过程。此外,与以往需要额外音视频融合模块的双流网络不同,JTG将音视频融合和question-aware temporal grounding统一到简化的单流架构中。它将音频和视频视为一个整体,并通过我们提出的跨模态同步(CMS)损失,将预训练的图像-文本知识扩展到音频-文本匹配中,同时保持其temporal correlation。在MUSIC-AVQA基准上进行的大量实验验证了我们方法有效性,优于现有SOTA方法。

关键词

引用

@article{arxiv.2405.07451,
  title  = {CLIP-Powered TASS: Target-Aware Single-Stream Network for Audio-Visual Question Answering},
  author = {Yuanyuan Jiang and Jianqin Yin},
  journal= {arXiv preprint arXiv:2405.07451},
  year   = {2024}
}

备注

Submitted to the Journal on February 6, 2024