基于管状令牌的视频人体-物体交互检测
计算机视觉与模式识别
2022-06-07 v1
摘要
我们提出了一种新颖的视觉Transformer,名为TUTOR,它能够学习管状令牌(tubelet tokens),作为高度抽象化的时空表征,用于基于视频的人体-物体交互(V-HOI)检测。管状令牌通过在空间和时间域上聚合与链接语义相关的块令牌来结构化视频,具有两个优势:1)紧凑性:每个管状令牌通过选择性注意力机制学习,以减少来自其他令牌的冗余空间依赖;2)表达性:得益于聚合与链接,每个管状令牌能够跨帧与语义实例(即物体或人)对齐。TUTOR的有效性与高效性通过大量实验得到验证。结果表明,我们的方法大幅优于现有工作,在VidHOI上相对mAP提升,在CAD-120上提升2个点,并实现加速。
引用
@article{arxiv.2206.01908,
title = {Video-based Human-Object Interaction Detection from Tubelet Tokens},
author = {Danyang Tu and Wei Sun and Xiongkuo Min and Guangtao Zhai and Wei Shen},
journal= {arXiv preprint arXiv:2206.01908},
year = {2022}
}