Social Fabric:用于视频关系检测的管状片段组合
计算机视觉与模式识别
2021-08-20 v1
摘要
本文致力于将视频中出现的物体管状片段(object tubelet)之间的关系分类并检测为<subject-predicate-object>三元组。现有工作将物体提议或管状片段视为单一实体并事后建模其关系,我们提出先验地对物体管状片段对分类并检测谓词。我们还提出Social Fabric:一种将物体管状片段对表示为交互基元(interaction primitives)组合的编码。这些基元在所有关系上学习,形成紧凑表示,能够从视频中所有时间跨度内共现的物体管状片段集合中定位并分类关系。该编码支撑我们的两阶段网络。第一阶段,我们训练Social Fabric以建议可能交互的提议。我们在第二阶段使用Social Fabric同时微调并预测管状片段的谓词标签。实验证明了早期视频关系建模、我们的编码和两阶段架构的益处,在两个基准上取得了新的最先进(state-of-the-art)结果。我们还展示了该编码如何实现基于基元示例的查询来搜索时空视频关系。代码:https://github.com/shanshuo/Social-Fabric。
引用
@article{arxiv.2108.08363,
title = {Social Fabric: Tubelet Compositions for Video Relation Detection},
author = {Shuo Chen and Zenglin Shi and Pascal Mettes and Cees G. M. Snoek},
journal= {arXiv preprint arXiv:2108.08363},
year = {2021}
}
备注
ICCV 2021