面向端到端长期视频问答的多粒度对比跨模态协作生成
计算机视觉与模式识别
2024-10-15 v1 人工智能
摘要
长期视频问答(VideoQA)是一项具有挑战性的视觉语言桥接任务,聚焦于对未剪辑长期视频和多样化自由形式问题的语义理解,同时强调综合跨模态推理以产生精确答案。典型方法常依赖即插即用的特征提取器,以规避昂贵的计算开销,但往往导致领域独立且模态无关的表征。此外,单模态理解与跨模态交互之间固有的梯度阻塞,阻碍可靠的答案生成。相比之下,近期成功的视频语言预训练模型实现了成本有效的端到端建模,但在领域特定推理方面不足,并存在任务公式差异。为此,我们提出一种完全端到端的长期VideoQA解决方案:多粒度对比跨模态协作生成(MCG)模型。为获得具备高视觉概念的判别性表征,我们在clip骨架上引入联合单模态建模(JUM),并利用多粒度对比学习(MCL)来捕获内在或显式展现的语义对应关系。为缓解任务公式差异问题,我们提出跨模态协作生成(CCG)模块,将VideoQA重新表述为生成任务而非传统分类方案,使模型具备跨模态高语义融合与生成能力,从而为答案的合理化提供支持。在六个公开可用的VideoQA数据集上进行的广泛实验表明,我们所提方法的优势显而易见。
引用
@article{arxiv.2410.09379,
title = {Multi-granularity Contrastive Cross-modal Collaborative Generation for End-to-End Long-term Video Question Answering},
author = {Ting Yu and Kunhao Fu and Jian Zhang and Qingming Huang and Jun Yu},
journal= {arXiv preprint arXiv:2410.09379},
year = {2024}
}
备注
Transactions on Image Processing