基于轨迹片段的视觉 Transformer 视频关系检测
计算机视觉与模式识别
2021-08-20 v1
摘要
视频视觉关系检测(VidVRD)近年来受到了我们领域的显著关注。本文中,我们采用最先进的视频目标轨迹片段检测流水线 MEGA 和 deepSORT 来生成轨迹片段提议。随后我们以基于轨迹片段的方式执行 VidVRD,无需任何预切割操作。具体而言,我们设计了一个基于轨迹片段的视觉 Transformer。它包含一个时间感知解码器,在轨迹片段与可学习的谓词查询嵌入之间进行特征交互,并最终预测关系。实验结果有力地证明了我们方法的优越性,在 ACM Multimedia 2021 的视频关系理解(VRU)大挑战中以大幅优势超越其他方法。代码发布于 https://github.com/Dawn-LX/VidVRD-tracklets。
引用
@article{arxiv.2108.08669,
title = {Video Relation Detection via Tracklet based Visual Transformer},
author = {Kaifeng Gao and Long Chen and Yifeng Huang and Jun Xiao},
journal= {arXiv preprint arXiv:2108.08669},
year = {2021}
}
备注
1st of Video Relation Understanding (VRU) Grand Challenge in ACM Multimedia 2021