中文

通过解耦时空建模学习细粒度视觉理解以用于视频问答

计算机视觉与模式识别 2022-10-11 v1 计算与语言

摘要

尽管近期大规模视频-语言预训练在视频问答上取得重大进展,视频-语言模型的空间建模设计不如图像-语言模型精细;现有时间建模实践也存在模态间对齐弱且含噪的问题。为学习细粒度视觉理解,我们解耦时空建模并提出一种混合流水线——解耦时空编码器,集成一个图像-语言与一个视频-语言编码器。前者独立于时间地从更大但稀疏采样的帧中编码空间语义,后者以较低空间但较高时间分辨率建模时间动态。为帮助视频-语言模型学习视频问答的时间关系,我们提出一种新的预训练目标——时间指称建模,要求模型识别视频序列中事件的时间位置。大量实验表明,我们的模型优于在数量级更大数据集上预训练的已有工作。

关键词

引用

@article{arxiv.2210.03941,
  title  = {Learning Fine-Grained Visual Understanding for Video Question Answering via Decoupling Spatial-Temporal Modeling},
  author = {Hsin-Ying Lee and Hung-Ting Su and Bing-Chen Tsai and Tsung-Han Wu and Jia-Fong Yeh and Winston H. Hsu},
  journal= {arXiv preprint arXiv:2210.03941},
  year   = {2022}
}

备注

BMVC 2022. Code is available at https://github.com/shinying/dest