基于联合潜在排序嵌入的多标签零样本人体动作识别
计算机视觉与模式识别
2019-02-07 v3 人工智能
机器学习
摘要
人体动作识别是指从视频片段中自动识别人体动作。现实中,视频流中常存在多个人体动作。此类视频流通常在全局层面用一组相关的人体动作标签进行弱标注,而不是将每个标签分配给对应于单个动作的特定视频片段,这导致了多标签学习问题。此外,现实中有许多有意义的人体动作,但收集/标注关于所有各种人体动作的视频片段极其困难,这导致了零样本学习场景。据我们所知,尚无工作在人体动作识别中同时解决上述所有问题。本文中将真实世界人体动作识别任务表述为多标签零样本学习问题,并提出一个框架以整体方式解决该问题。我们的框架整体处理多标签学习中不同动作间未知时间边界的问题,并利用关于不同人体动作间语义关系的侧信息来进行知识迁移。因此,我们的框架产生了用于多标签零样本人体动作识别的联合潜在排序嵌入。提出了一种由两组件模型组成的新型神经架构和一种交替学习算法来执行联合潜在排序嵌入学习。从而,多标签零样本识别通过在联合潜在视觉与语义嵌入空间中测量动作标签与测试视频片段的相关分数来完成。我们在不同设置下评估我们的框架,包括专为评估多标签零样本学习而设计的新型数据划分方案,使用了两个数据集:Breakfast和Charades。实验结果证明了我们框架的有效性。
引用
@article{arxiv.1709.05107,
title = {Multi-Label Zero-Shot Human Action Recognition via Joint Latent Ranking Embedding},
author = {Qian Wang and Ke Chen},
journal= {arXiv preprint arXiv:1709.05107},
year = {2019}
}
备注
27 pages, 10 figures and 7 tables. Technical report submitted to a journal. More experimental results/references were added and typos were corrected