零样本人群行为识别
计算机视觉与模式识别
2019-08-19 v1
摘要
理解视频中的人群行为对计算机视觉而言具有挑战性。通过引入越来越大的属性本体(attributes)并标注越来越大的训练数据集来建模拥挤场景的尝试不断增多。然而,与静态图像相比,人工标注视频属性需要考虑时空演化,这本质上要困难得多且成本更高。关键的是,监控视频中捕获的最有趣的人群行为(例如街头斗殴、快闪族)要么罕见因而可用于模型训练的样本极少,要么此前从未见过。现有人群分析技术不易扩展到识别新颖(未见)的人群行为。为解决此问题,我们研究并开发了无需任何训练样本即可识别视觉人群行为属性的方法,即零样本学习人群行为识别。为此,我们放宽了每个单独人群视频实例仅与单一人群属性相关联的通常假设。相反,我们的模型通过学习联合识别每个视频实例中的多个群行为属性,利用多属性共现作为上下文知识来优化个体人群属性识别。零样本学习中的联合多标签属性预测本质上非平凡,因为对于未见属性不存在共现统计。为解决这个问题,我们学习从在线文本语料库以及具有已知属性的视频的多标签标注中预测跨属性共现。我们的实验表明,这种对多属性上下文建模的方法不仅在 WWW 人群视频数据集上改进了零样本人群行为识别,而且可泛化到 Violence Flow 视频数据集中跨域的新颖行为(暴力)检测。
引用
@article{arxiv.1908.05877,
title = {Zero-Shot Crowd Behavior Recognition},
author = {Xun Xu and Shaogang Gong and Timothy Hospedales},
journal= {arXiv preprint arXiv:1908.05877},
year = {2019}
}
备注
Group and Crowd Behavior for Computer Vision 2017, Pages 341-369