中文

TESTA:面向长视频语言理解的时间-空间词元聚合方法

计算机视觉与模式识别 2023-10-31 v1 人工智能 计算与语言

摘要

大规模视频-语言预训练在推进视频-语言理解任务方面取得了显著进展。然而,视频编码的沉重计算负担仍是一个严峻的效率瓶颈,尤其对于长视频而言。这些视频因其固有的3D特性与时空冗余而包含海量视觉词元,使得捕捉复杂的时间与空间关系颇具挑战。为解决此问题,我们提出了一种名为时间-空间词元聚合(TEmporal-Spatial Token Aggregation, TESTA)的高效方法。TESTA通过自适应聚合相似帧以及每帧内相似图像块来浓缩视频语义。TESTA可将视觉词元数量减少75%,从而加速视频编码。基于TESTA,我们引入了一个预训练视频-语言模型,其在每个视频编码器块中配备了分离式时空词元聚合模块。我们在五个数据集上评估了我们的模型在段落到视频检索与长视频问答(VideoQA)任务上的表现。实验结果表明,TESTA将计算效率提升了1.7倍,并因其在处理更长输入帧时的可扩展性获得了显著的性能增益,例如在QuerYD上+13.7 R@1,在Condensed Movie上+6.5 R@1。

关键词

引用

@article{arxiv.2310.19060,
  title  = {TESTA: Temporal-Spatial Token Aggregation for Long-form Video-Language Understanding},
  author = {Shuhuai Ren and Sishuo Chen and Shicheng Li and Xu Sun and Lu Hou},
  journal= {arXiv preprint arXiv:2310.19060},
  year   = {2023}
}

备注

16 pages, 9 figures, code is available at https://github.com/RenShuhuai-Andy/TESTA