用于细粒度视频理解的时间查询网络
计算机视觉与模式识别
2021-04-20 v1
摘要
本工作的目标是对未裁剪视频中的动作进行细粒度分类,其中动作可能是时间上延展的,也可能仅跨越视频的几帧。我们将其构建为一种查询-响应机制,其中每个查询针对一个特定问题,并拥有自己的响应标签集。我们做出以下四点贡献:(I)我们提出了一种新模型——时间查询网络(Temporal Query Network)——它实现了查询-响应功能,并对细粒度动作提供结构化理解。它通过时间注意力机制关注每个查询的相关片段,并且可以仅使用每个查询的标签进行训练。(ii)我们提出了一种新方法——随机特征库更新——以在具有不同长度且需要密集采样来响应细粒度查询的视频上训练网络。(iii)我们将TQN与其他架构及文本监督方法进行比较,并分析其优缺点。最后,(iv)我们在FineGym和Diving48基准上广泛评估该方法用于细粒度动作分类,仅使用RGB特征便超越了当前最优(state-of-the-art)方法。
引用
@article{arxiv.2104.09496,
title = {Temporal Query Networks for Fine-grained Video Understanding},
author = {Chuhan Zhang and Ankush Gupta and Andrew Zisserman},
journal= {arXiv preprint arXiv:2104.09496},
year = {2021}
}
备注
Accepted to CVPR 2021(Oral). Project page: http://www.robots.ox.ac.uk/~vgg/research/tqn/