ActionHub:用于零样本动作识别的大规模动作视频描述数据集
计算机视觉与模式识别
2024-01-23 v1
摘要
零样本动作识别(ZSAR)旨在学习视频与已见动作类别描述之间的对齐模型,并将其迁移至未见动作。然而,现有 ZSAR 工作中使用的文本查询(类别描述)往往是简短的动作名称,无法捕捉视频中丰富的语义,从而导致对齐偏差。基于视频内容描述(如视频字幕)能提供视频中视觉概念丰富上下文信息的直觉,我们提出利用人工标注的视频描述来丰富每个动作类别描述的语义。然而,现有的动作视频描述数据集在动作数量、视频描述语义等方面均存在局限。为此,我们收集了一个名为 ActionHub 的大规模动作视频描述数据集,涵盖总共 1,211 个常见动作,并提供 360 万条动作视频描述。利用提出的 ActionHub 数据集,我们进一步提出了一种用于 ZSAR 的新型跨模态与跨动作建模(CoCo)框架,该框架由双重跨模态对齐模块和跨动作不变性挖掘模块组成。具体而言,双重跨模态对齐模块利用来自 ActionHub 的动作标签和视频描述,获取丰富的类别语义特征以进行特征对齐。跨动作不变性挖掘模块利用已见动作与未见动作的类别语义特征空间之间的循环重构过程,旨在引导模型学习跨动作不变表示。大量实验结果表明,在两种不同的 ZSAR 学习协议下,我们的 CoCo 框架在三个流行的 ZSAR 基准(即 Kinetics-ZSAR、UCF101 和 HMDB51)上显著优于最先进方法。我们将发布代码、模型以及提出的 ActionHub 数据集。
引用
@article{arxiv.2401.11654,
title = {ActionHub: A Large-scale Action Video Description Dataset for Zero-shot Action Recognition},
author = {Jiaming Zhou and Junwei Liang and Kun-Yu Lin and Jinrui Yang and Wei-Shi Zheng},
journal= {arXiv preprint arXiv:2401.11654},
year = {2024}
}