LiteVL:具有增强时空建模的高效视频-语言学习
计算机视觉与模式识别
2022-10-24 v1 计算与语言
摘要
近期大规模视频-语言预训练模型在各种下游任务上展现出引人注目的性能。然而,由于需要数百万视频-文本对以及每支视频冗余的数据结构,预训练过程计算代价高昂。为缓解这些问题,我们提出 LiteVL,它直接在下游任务上将预训练的图像-语言模型 BLIP 适配为视频-文本模型,无需繁重预训练。为增强图像-语言模型所缺乏的时间建模,我们提出在 BLIP 的图像编码器中加入具有动态时间缩放的时间注意力模块。除模型层面的适配外,我们还提出一种非参数池化机制,根据文本自适应地对细粒度视频嵌入重新加权。在文本-视频检索和视频问答上的实验结果表明,所提 LiteVL 即使无任何视频-语言预训练,也以明显优势优于先前的视频-语言预训练模型。
引用
@article{arxiv.2210.11929,
title = {LiteVL: Efficient Video-Language Learning with Enhanced Spatial-Temporal Modeling},
author = {Dongsheng Chen and Chaofan Tao and Lu Hou and Lifeng Shang and Xin Jiang and Qun Liu},
journal= {arXiv preprint arXiv:2210.11929},
year = {2022}
}
备注
13 pages, 6 figures, accepted by EMNLP 2022 main conference