先扫视再聚焦:结合上下文与细粒度视图的重复动作计数
计算机视觉与模式识别
2024-06-14 v1
摘要
动作计数的关键在于准确定位视频中的每个重复动作。我们不直接估计每一帧属于某个动作的概率,而是提出一个双分支网络,即SkimFocusNet,它以两步方式工作。该模型的灵感来源于经验观察,即人类通常先对整个序列进行粗略扫视以掌握一般动作模式,然后逐帧更精细地聚焦以确定其是否与目标动作一致。具体来说,SkimFocusNet包含一个扫视分支和一个聚焦分支。扫视分支扫描整个序列的全局上下文信息,以识别潜在的目标动作进行引导。随后,聚焦分支利用该引导,通过长短期自适应引导(LSAG)模块来仔细识别重复动作。此外,我们观察到现有数据集中的视频通常只包含一种类型的重复动作,这不能充分代表现实场景。为了更准确地描述现实情况,我们建立了Multi-RepCount数据集,其中包含包含多种重复动作的视频。在Multi-RepCount上,我们的SkimFocusNet可以执行指定动作计数,即通过参考示例视频来计数特定动作类型。这一能力充分展示了我们方法的鲁棒性。大量实验表明,SkimFocusNet以显著的改进达到了最先进的性能。我们还进行了彻底的消融研究来评估网络组件。源代码将在论文被接收后发布。
引用
@article{arxiv.2406.08814,
title = {Skim then Focus: Integrating Contextual and Fine-grained Views for Repetitive Action Counting},
author = {Zhengqi Zhao and Xiaohu Huang and Hao Zhou and Kun Yao and Errui Ding and Jingdong Wang and Xinggang Wang and Wenyu Liu and Bin Feng},
journal= {arXiv preprint arXiv:2406.08814},
year = {2024}
}
备注
13 pages, 9 figures