中文

LocFormer:通过特征采样方法使 Transformer 能在长未剪辑视频上进行时序时刻定位

计算机视觉与模式识别 2021-12-21 v1

摘要

我们提出 LocFormer,一种基于 Transformer 的视频定位模型,其内存占用与视频长度(即帧数)无关而保持恒定。LocFormer 专为需要处理整段长视频的任务而设计,其核心包含两个主要贡献。首先,我们的模型引入了一种新的采样技术,将输入特征序列划分为固定数量的段,并采用随机方法每段选取单一特征,这使我们能获得代表当前任务视频内容的特征样本集,同时保持内存占用恒定。其次,我们提出了一种分离功能的模块化设计,使我们能够通过监督自注意力头学习归纳偏置,同时有效利用预训练的文本与视频编码器。我们在视频定位相关基准数据集上测试了我们的方案,表明 LocFormer 不仅能取得优异结果(包括在 YouCookII 上达到 SOTA 性能),而且我们的采样技术比竞争方法更有效,并持续将先前工作的性能提升高达 3.13% 的平均时序 IoU,最终在 Charades-STA 上取得新的 SOTA 性能。

关键词

引用

@article{arxiv.2112.10066,
  title  = {LocFormer: Enabling Transformers to Perform Temporal Moment Localization on Long Untrimmed Videos With a Feature Sampling Approach},
  author = {Cristian Rodriguez-Opazo and Edison Marrese-Taylor and Basura Fernando and Hiroya Takamura and Qi Wu},
  journal= {arXiv preprint arXiv:2112.10066},
  year   = {2021}
}