通过目标令牌的帧-片段一致性将图像场景结构引入视频
计算机视觉与模式识别
2022-11-30 v3
摘要
近期的动作识别模型通过整合物体、其位置及交互取得了令人印象深刻的成果。然而,为每一帧获取稠密结构化标注繁琐且耗时,使得这些方法训练代价高昂且可扩展性较差。同时,若有少量标注图像可用(无论是否在目标领域内),我们如何将其用于视频下游任务?我们提出了一种学习框架 StructureViT(简称 SViT),展示了仅利用训练期间可用的一小部分图像的结构如何改进视频模型。SViT 依赖于两个关键见解。首先,由于图像和视频均包含结构化信息,我们用一组可跨图像和视频使用的\emph{目标令牌}(object tokens)来丰富 transformer 模型。其次,视频中单帧的场景表示应与静态图像的相“对齐”。这通过\emph{帧-片段一致性}(Frame-Clip Consistency)损失实现,该损失确保结构化信息在图像与视频间流动。我们探究了场景结构的一种具体实例,即\emph{手-物图}(Hand-Object Graph),以手与物体及其位置为节点,以接触/非接触的物理关系为边。SViT 在多个视频理解任务与数据集上表现出强劲的性能提升。此外,它在 Ego4D CVPR'22 物体状态定位挑战赛中获胜。有关代码与预训练模型,请访问项目页面 \url{https://eladb3.github.io/SViT/}。
引用
@article{arxiv.2206.06346,
title = {Bringing Image Scene Structure to Video via Frame-Clip Consistency of Object Tokens},
author = {Elad Ben-Avraham and Roei Herzig and Karttikeya Mangalam and Amir Bar and Anna Rohrbach and Leonid Karlinsky and Trevor Darrell and Amir Globerson},
journal= {arXiv preprint arXiv:2206.06346},
year = {2022}
}
备注
Tech report