中文

结构化视频令牌 @ Ego4D PNR 时序定位挑战赛 2022

计算机视觉与模式识别 2022-06-16 v1

摘要

本技术报告描述了用于 Ego4D 不可返回点(PNR)时序定位挑战赛的 SViT 方法。我们提出了一种学习框架 StructureViT(简称 SViT),展示了如何利用仅在训练期间可用的一小部分图像的结构来改进视频模型。SViT 依赖于两个关键见解。首先,由于图像和视频都包含结构化信息,我们用一组可在图像和视频间使用的\emph{对象令牌}(object tokens)来丰富 transformer 模型。其次,视频中各个帧的场景表示应与静态图像的那些表示“对齐”。这通过“帧-片段一致性”(Frame-Clip Consistency)损失实现,该损失确保了结构化信息在图像和视频之间的流动。SViT 在挑战赛测试集上取得了强劲性能,绝对时序定位误差为 0.656。

关键词

引用

@article{arxiv.2206.07689,
  title  = {Structured Video Tokens @ Ego4D PNR Temporal Localization Challenge 2022},
  author = {Elad Ben-Avraham and Roei Herzig and Karttikeya Mangalam and Amir Bar and Anna Rohrbach and Leonid Karlinsky and Trevor Darrell and Amir Globerson},
  journal= {arXiv preprint arXiv:2206.07689},
  year   = {2022}
}

备注

Ego4D CVPR22 Object State Localization challenge. arXiv admin note: substantial text overlap with arXiv:2206.06346