中文

基于轨迹片段的视觉 Transformer 视频关系检测

计算机视觉与模式识别 2021-08-20 v1

摘要

视频视觉关系检测(VidVRD)近年来受到了我们领域的显著关注。本文中,我们采用最先进的视频目标轨迹片段检测流水线 MEGA 和 deepSORT 来生成轨迹片段提议。随后我们以基于轨迹片段的方式执行 VidVRD,无需任何预切割操作。具体而言,我们设计了一个基于轨迹片段的视觉 Transformer。它包含一个时间感知解码器,在轨迹片段与可学习的谓词查询嵌入之间进行特征交互,并最终预测关系。实验结果有力地证明了我们方法的优越性,在 ACM Multimedia 2021 的视频关系理解(VRU)大挑战中以大幅优势超越其他方法。代码发布于 https://github.com/Dawn-LX/VidVRD-tracklets。

关键词

引用

@article{arxiv.2108.08669,
  title  = {Video Relation Detection via Tracklet based Visual Transformer},
  author = {Kaifeng Gao and Long Chen and Yifeng Huang and Jun Xiao},
  journal= {arXiv preprint arXiv:2108.08669},
  year   = {2021}
}

备注

1st of Video Relation Understanding (VRU) Grand Challenge in ACM Multimedia 2021