用于长视频理解的文本条件重采样器
计算机视觉与模式识别
2024-08-20 v3
摘要
在本文中,我们提出了一个文本条件的视频重采样器 (TCR) 模块,该模块使用预训练且冻结的视觉编码器和大语言模型 (LLM) 来为任务处理长视频序列。TCR 根据文本条件从视频中定位相关的视觉特征,并将其提供给 LLM 以生成文本响应。由于其轻量级设计和交叉注意力的使用,TCR 可以使用普通注意力机制一次处理超过 100 帧,且无需优化实现。我们做出以下贡献:(i) 我们设计了一种基于 Transformer 的采样架构,能够处理以任务为条件的长视频,并配有一套使其能够桥接预训练视觉和语言模型的训练方法;(ii) 我们识别了可以从更长视频感知中受益的任务;(iii) 我们在包括 NextQA、EgoSchema 和 EGO4D-LTA 挑战在内的各种评估任务上实证验证了其有效性。
引用
@article{arxiv.2312.11897,
title = {Text-Conditioned Resampler For Long Form Video Understanding},
author = {Bruno Korbar and Yongqin Xian and Alessio Tonioni and Andrew Zisserman and Federico Tombari},
journal= {arXiv preprint arXiv:2312.11897},
year = {2024}
}
备注
Accepted to the ECCV24 conference