面向高效二维时序视频定位的文本-视觉提示
计算机视觉与模式识别
2023-10-05 v3 人工智能
摘要
本文研究时序视频定位(TVG)问题,旨在预测长未剪辑视频中由文本句子描述的片段的起止时间点。得益于细粒度的3D视觉特征,TVG技术近年来取得了显著进展。然而,3D卷积神经网络(CNN)的高复杂度使得提取密集3D视觉特征十分耗时,需要大量的内存和计算资源。为实现高效TVG,我们提出一种新颖的文本-视觉提示(TVP)框架,将优化后的扰动模式(我们称之为“提示”)注入TVG模型的视觉输入与文本特征中。与3D CNN形成鲜明对比的是,我们表明TVP使我们能够在2D TVG模型中有效协同训练视觉编码器与语言编码器,并仅使用低复杂度的稀疏2D视觉特征就改善跨模态特征融合的性能。此外,我们提出时序距离IoU(TDIoU)损失以实现TVG的高效学习。在Charades-STA和ActivityNet Captions两个基准数据集上的实验表明,所提出的TVP显著提升了2D TVG性能(例如在Charades-STA上提升9.79%,在ActivityNet Captions上提升30.77%),并相比使用3D视觉特征的TVG实现了5倍推理加速。代码已在Open.Intel发布。
引用
@article{arxiv.2303.04995,
title = {Text-Visual Prompting for Efficient 2D Temporal Video Grounding},
author = {Yimeng Zhang and Xin Chen and Jinghan Jia and Sijia Liu and Ke Ding},
journal= {arXiv preprint arXiv:2303.04995},
year = {2023}
}
备注
Accepted to the CVPR 2023 and code released (https://github.com/intel/TVP)