中文

利用自然语言在视频集合中查找时刻

计算机视觉与模式识别 2022-02-24 v2 计算与语言

摘要

我们提出了给定自然语言查询从大型未裁剪、未分割视频语料库中检索相关视频时刻的任务。我们的任务带来了独特挑战,因为系统必须高效识别相关视频并定位视频中的相关时刻。为应对这些挑战,我们提出了语言时空对齐(STAL),一种将视频时刻表示为一系列短视频片段中区域集合并将自然语言查询与该时刻区域对齐的模型。我们的对齐代价使用对称平方 Chamfer 距离比较变长语言与视频特征,从而允许对视频时刻进行高效索引与检索。此外,将语言特征对齐到视频时刻内的区域,相比于仅从整个视频时刻提取聚合特征的方法,可实现更精细的对齐。我们在两个近期提出的用于自然语言视频时刻时间定位的数据集(DiDeMo 和 Charades-STA)上评估我们的方法,并将其扩展到我们的视频语料库时刻检索设定。我们表明,我们的 STAL 重排序模型在我们提出的任务上所有数据集的所有标准均优于近期提出的 Moment Context Network,平均召回率相对提升 37%–118%,中位排名提升高达 30%。此外,在近似设定下使用 100 万视频语料库,我们的方法实现了超过 130 倍的更快检索与 8 倍更小的索引尺寸。

关键词

引用

@article{arxiv.1907.12763,
  title  = {Finding Moments in Video Collections Using Natural Language},
  author = {Victor Escorcia and Mattia Soldan and Josef Sivic and Bernard Ghanem and Bryan Russell},
  journal= {arXiv preprint arXiv:1907.12763},
  year   = {2022}
}