面向多标签多视角动作识别的动作选择学习
计算机视觉与模式识别
2024-10-21 v3
摘要
多标签多视角动作识别旨在从由多台摄像机捕获的未剪辑视频中识别多个并发或顺序动作。现有工作集中于在标签充足的场景下进行多视角动作识别,仅在帧级对每个动作的起始和结束进行标注。本研究聚焦于实际场景——摄像机分布覆盖广泛区域,仅在视频级提供弱标签。我们提出一种名为多视角动作选择学习(Multi-view Action Selection Learning, MultiASL)的方法,利用动作选择学习以选择不同视角中最有用的信息进行融合。该方法包含一种多视角时空 Transformer 视频编码器,从多视角视频中提取空间和时间特征。动作选择学习在帧级上采用从视频级弱标签获得的伪 ground-truth,以识别动作识别最相关的帧。我们在真实办公环境中使用 MM-Office 数据集进行实验,结果表明所提方法在现有方法之上显著优异。源代码已公开于 https://github.com/thanhhff/MultiASL/。
引用
@article{arxiv.2410.03302,
title = {Action Selection Learning for Multi-label Multi-view Action Recognition},
author = {Trung Thanh Nguyen and Yasutomo Kawanishi and Takahiro Komamizu and Ichiro Ide},
journal= {arXiv preprint arXiv:2410.03302},
year = {2024}
}
备注
ACM Multimedia Asia 2024