Tem-Adapter:适配图文预训练用于视频问答
计算机视觉与模式识别
2023-08-17 v1
摘要
视频-语言预训练模型在指导视频问答(VideoQA)任务方面已展现出显著成功。然而,由于视频序列的长度,训练大规模基于视频的模型比训练基于图像的模型成本高得多。这促使我们利用来自图像预训练的知识,尽管图像与视频域之间存在明显鸿沟。为弥合这些鸿沟,本文提出 Tem-Adapter,其通过视觉时间对齐器和文本语义对齐器实现时间动态与复杂语义的学习。不同于仅关注下游任务目标的常规预训练知识适配方法,时间对齐器引入了一项额外的语言引导自回归任务,旨在促进时间依赖性的学习,其目标是基于历史线索与描述事件进展的语言引导来预测未来状态。此外,为减小语义鸿沟并适配文本表示以更好地描述事件,我们引入语义对齐器,其首先设计模板将问题与答案对融合为事件描述,然后以整个视频序列为引导学习一个 Transformer 解码器进行精炼。我们在两个 VideoQA 基准上评估了 Tem-Adapter 与不同预训练迁移方法,显著的性能提升证明了我们方法的有效性。
引用
@article{arxiv.2308.08414,
title = {Tem-adapter: Adapting Image-Text Pretraining for Video Question Answer},
author = {Guangyi Chen and Xiao Liu and Guangrun Wang and Kun Zhang and Philip H. S. Torr and Xiao-Ping Zhang and Yansong Tang},
journal= {arXiv preprint arXiv:2308.08414},
year = {2023}
}
备注
ICCV 2023