演员识别的时空动作检测——检测视频中谁在做什么
摘要
深度学习在视频动作识别(Action Recognition, AR)上的成功促使研究者将相关任务从粗粒度逐步推进到细粒度。与仅预测整段视频动作标签的传统 AR 相比,时序动作检测(Temporal Action Detection, TAD)已被研究用于估计视频中每个动作的起止时间。在 TAD 基础上更进一步的时空动作检测(Spatiotemporal Action Detection, SAD)被研究用于在视频中时空定位动作。然而,SAD 通常忽略动作的执行者,而识别演员也可能十分重要。为此,我们提出新任务——演员识别的时空动作检测(Actor-identified Spatiotemporal Action Detection, ASAD),以弥合 SAD 与演员识别间的鸿沟。在 ASAD 中,我们不仅检测实例级动作的时空边界,还为各演员分配唯一 ID。实现 ASAD 的两个基本要素是多目标跟踪(Multiple Object Tracking, MOT)与动作分类(Action Classification, AC)。通过 MOT 获得各演员的时空边界并赋予唯一演员身份;通过 AC 在相应时空边界内估计动作类别。由于 ASAD 是新任务,其带来许多现有方法无法应对的挑战:i) 无专门创建的 ASAD 数据集,ii) 无针对 ASAD 设计的评估指标,iii) 当前 MOT 性能是获得满意 ASAD 结果的瓶颈。为解决这些问题,我们贡献如下:i) 标注新的 ASAD 数据集,ii) 提出考虑多标签动作与演员识别的 ASAD 评估指标,iii) 改进 MOT 中的数据关联策略以提升 MOT 性能,从而获得更好的 ASAD 结果。代码见 https://github.com/fandulu/ASAD。
引用
@article{arxiv.2208.12940,
title = {Actor-identified Spatiotemporal Action Detection -- Detecting Who Is Doing What in Videos},
author = {Fan Yang and Norimichi Ukita and Sakriani Sakti and Satoshi Nakamura},
journal= {arXiv preprint arXiv:2208.12940},
year = {2022}
}