中文

UnLoc:一种用于视频定位任务的统一框架

计算机视觉与模式识别 2023-08-23 v1 机器学习

摘要

尽管诸如 CLIP 等大规模图像-文本预训练模型已被用于裁剪后视频上的多种视频级任务,但其在未裁剪视频中的时间定位应用仍属相对未充分探索的任务。我们为此设计了一种称为 UnLoc 的新方法,其使用预训练的图像与文本塔,并将 token 输入视频-文本融合模型。融合模块的输出随后用于构建特征金字塔,其中每一层连接一个头以预测逐帧相关性分数及起止时间位移。与以往工作不同,我们的架构以单阶段模型实现 Moment Retrieval、Temporal Localization 与 Action Segmentation,无需动作提议、基于运动的预训练特征或表示掩码。不同于专用模型,我们以统一方法在所有三种不同定位任务上均取得了 SOTA 结果。代码将发布于:\url{https://github.com/google-research/scenic}。

关键词

引用

@article{arxiv.2308.11062,
  title  = {UnLoc: A Unified Framework for Video Localization Tasks},
  author = {Shen Yan and Xuehan Xiong and Arsha Nagrani and Anurag Arnab and Zhonghao Wang and Weina Ge and David Ross and Cordelia Schmid},
  journal= {arXiv preprint arXiv:2308.11062},
  year   = {2023}
}

备注

ICCV 2023